
GEV-26B-Decide 长文本决策256K上下文中如何秒级定位关键信息【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-DecideGEV-26B-Decide 是一款基于 Gemma-4-26B 的开源长文本决策模型它拥有 256K 原生上下文对任意长文本在一次前向传播中直接输出每个选项的校准概率把关键信息定位从慢慢读、慢慢写变成一次读完、秒级出答案全程不生成一个字。它解决什么问题传统大模型处理长文本的方式是读完再写——逐字生成思考过程慢且不稳定。GEV-26B-Decide 换了个思路不回答问题只输出概率分布。问题、长文本、选项一次送入模型最后一层的隐藏状态直接穿过一个 24 槽位的轻量决策头见 head.safetensorssoftmax 之后每个选项各有一个概率。这意味着⚡秒级短文本单请求中位数约 45 ms128K 长文也在 18 s 内完成单卡 B200确定性输出yes/no、2–256 个选项的多选、0–5 打分三种类型化决策概率可信每个选项的概率经过温度校准calibration.jsonECE 仅 0.035可直接用于自动动作的置信度门槛256K 长文本定位实测全对官方在 README.md 中给出了一组针对大海捞针式定位能力的测试把决定答案的单句话随机埋入由真实 PubMedQA 摘要拼接成的长文中再提问是/否和 16 选项问题每个长度各 10 题单卡 B200 vLLM提示长度是/否正确16 选项正确正确项平均概率中位延迟4K10/1010/100.9990.15 s32K10/1010/100.9991.6 s64K10/1010/100.9995.0 s128K10/1010/101.00017.8 s关键结论无论关键句埋在多深模型都能一次定位、一次答对且对正确答案给出接近 1.0 的高置信度。延迟随长度增长主要来自读完输入本身而非生成。256K 是骨干模型的完整原生窗口config.json 中max_position_embeddings: 262144服务端默认--max-model-len 65536可通过MAX_MODEL_LEN环境变量放大到 262144。为什么能秒级定位三个设计单 token 读出零生成模型不写一个字。读完输入后只读取下一个 token在 A–P 等标签上的 logprob读取逻辑见 serve_decide.py天然避免了逐字生成的等待。滑动窗口 全局注意力混合30 层中每 5 层一个 full attention 覆盖全局config.json长距离依赖不丢失这正是 128K 深处还能锁定关键句的原因。MoE 的只激活 4B架构26B 总参数但每 token 仅激活约 4B128 个专家选 8 个读完长文后做一次小决策头计算成本极低。自适应思考只在没把握时才想模型不止一个模式。开启thinking: auto后见 serve_decide.pySystem 1 先秒出分布 p1领先选项置信度低于 0.8时System 2未修改的 Gemma-4 思考模式才认真推理得到 p2最终p ½p1 ½p2兼得推理的准确率和 System 1 的校准。效果很直观各题 200 道详见 reports/thinking_games.json游戏随机System 1自适应思考Wordle12.552.0100.0Connect Four14.554.099.5扫雷25.021.086.0数独11.176.099.5Wordle 思考过程的实录视频模型逐词排除颜色反馈实践建议推理题数学、逻辑、代码因果开auto分类、检索、工具路由保持off——官方数据显示思考在这些任务上几乎无增益甚至略微拖累。快速部署两步启动 256K 决策服务hf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide bash GEV-26B-Decide/serve.sh # 单卡 80GBvLLM 起在 :8000serve.sh 启动的就是 serve_decide.py标准 vLLM OpenAI 服务 一个POST /v1/decide决策接口一个引擎同时服务快决策和深思考两套系统。长文本调用示例curl localhost:8000/v1/decide -H Content-Type: application/json -d { kind: noul, state: 你的 128K 长文, question: 文档中是否提到 X 方案已被否决, thinking: auto}返回即包含每个选项的概率、首选项、token 用量与思考统计可直接接入业务系统。文件导航文件说明README.md完整模型卡256K 实测、思考实验、部署细节serve_decide.py · serve.sh决策服务源码与启动脚本adapter/ · adapter_vllm/System 1 决策 LoRAtransformers / vLLM 两种形态head.safetensors · judge_config.json24 槽位决策头与读出协议calibration.json · calibration_gold.json按类型的校准温度自动动作建议用 gold 版patches/vllm-gemma4-lm-head-lora.patchvLLM 单引擎补丁已知边界128K 以上长度尚未测试图像决策为零样本System 1 在专家级难题HLE上接近随机水平思考也仅拉回随机线思考在长推理任务上可能耗满 8192 token 预算约 30 s延迟敏感场景请调低threshold/think_budget一句话总结如果你要在超长文档、合同、日志或代码库上做是/否 多选型判断GEV-26B-Decide 用读一次、出概率、不生成的路线把长文本关键信息定位做到了全对 秒级的组合。【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考