
GEV-26B-Decide 实战noul、score、choice 三种决策类型的正确用法【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-DecideGEV-26B-Decide 是一个基于 Gemma-4-26B-A4B-it 的决策模型它不生成回答而是对 noul是否判断、score0–5 打分、choice多选项选择三种问题直接输出每个选项的校准概率。本文带你快速掌握这三种决策类型的正确用法、POST /v1/decide接口的关键参数以及最容易踩的坑让决策服务一次跑通。30 秒认识 GEV-26B-Decide 决策模型 这套权重包含两个系统共用同一个 vLLM 引擎系统做什么输出System 1一次前向传播完成类型化决策yes/no、2–256 选 1、0–5 评分支持文本和图片每个选项的校准概率自适应思考thinking: autoSystem 1 先行置信度低于阈值默认 0.8时 System 2 参与推理两者等权混合后的校准概率System 1 单次决策约45 msB200 实测256K 上下文同一套权重同时处理文本与图像。决策头把 24 个槽位分给三种类型noul占 2 个、score占 6 个、choice占 16 个槽位布局见 judge_config.json。三种决策类型总览noul、score、choice 怎么选字段noulscorechoice问题形态是/否布尔0–5 分打分从 2–256 个选项中选一个选项固定为[false, true]固定为[0…5]你自定义的字符串列表是否支持thinking✅❌会返回 400 错误✅典型场景意图判断、风控拦截、合规校验情感/质量/满意度评分意图分类、工具路由、多选题一句话原则答案是二选一就用noul需要量级就用score开放式候选就用choice。三步启动下载模型并拉起决策服务hf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide bash GEV-26B-Decide/serve.sh # vLLM 起在 :8000需要 ≥80 GB 显存的 GPUserve.sh 会启动 serve_decide.py标准 vLLM OpenAI 服务 一个POST /v1/decide决策路由。它加载骨干模型一次——普通请求走 System 2OpenAI 端点决策请求走 LoRA 模块jev-decision即 System 1来自 adapter_vllm/。注意需要带 Gemma-4 支持的 vLLM 版本并应用补丁 patches/vllm-gemma4-lm-head-lora.patch。发一个最简请求验证服务curl localhost:8000/v1/decide -H Content-Type: application/json -d { kind: noul, state: Customer says the parcel arrived damaged and wants their money back., question: Is the customer asking for a refund?}响应核心字段options、probabilities与选项一一对应、choice、choice_index、usage请求过thinking时还有thinking信息块。GET /v1/decide/info可随时查看服务端默认值。noul 用法是否判断与意图识别noul即 yes/no 判断服务端固定返回false与true两个概率不需要传 options{ kind: noul, state: John was born on 29 February 1996., question: Was Johns 7th birthday celebrated on a 29 February? }它是客服路由、风控规则判断的主力。若问题偏推理加thinking: auto让 System 1 在置信度不足时自动唤起推理——例如自适应模式下 AQuA-RAT 数学题从 68.1% 提升到 89.0%验证数据汇总见 reports/decision_index_adaptive.json。score 用法0–5 分打分score让模型输出 0–5 六个档位上的概率分布适合情感极性、服务满意度、内容质量这类量级任务。⚠️最容易踩的坑score不支持思考。在 serve_decide.py 中kind为score时对thinking: auto/on的请求会直接返回 400thinking is supported for noul and choice。如果需要先推理再打分请改用noul/choice或走 System 2 聊天端点。choice 用法2–256 个选项的选择choice把候选项交给模型挑一个curl localhost:8000/v1/decide -H Content-Type: application/json -d { kind: choice, state: A bat and a ball cost $1.10 in total. The bat costs $1.00 more than the ball., question: How much does the ball cost?, options: [$0.10, $0.05, $1.00, $0.55], thinking: auto}关键机制与参数≤16 个选项一次前向读取训练过的 A–P 标签最快路径。16 个选项默认strategy: tournament——按组并行每组 ≤16再决出 16 名决赛所有选项都被读取、无剪枝。备选single单遍约 3 倍快但精度略降、permute4 种选项顺序取平均。实测能力150 个意图的 CLINC150 分类准确率达95.5%255 选项混合意图集 89.0%。读取响应与置信度校准拿到probabilities后不要只看 argmax要用概率做置信度门控默认温度来自 calibration.jsonnoul1.003 /choice1.017 /score0.999。若你的自动化动作依赖置信度阈值如概率 0.95 才自动执行建议改用对真实答案校准的 calibration_gold.json。请求时加debug: true可拿到 System 1 / System 2 的原始分布便于排查。避坑清单高频错误一次说清 坑说明给score传thinking直接 400score只走 System 1noul/score传自定义 options只接受固定选项[false,true]/ 0–5分类/检索任务开thinking: auto帮助很小甚至有害BANKING77 macro-F1 从 88.0 掉到 85.0推理题才开工具路由/意图分类保持off高并发下思考太慢调低threshold或设think_budget思考 token 上限换速度自己调/v1/completions读分布必须显式传top_k: 0、top_p: 1.0否则默认生成配置会截断概率小结noul管二选一score管 0–5 打分不支持思考choice管 2–256 选 1超 16 项默认 tournament 策略。推理类问题加thinking: auto分类/路由类保持off。用概率而非选择本身做置信度门控高置信自动化场景换用 calibration_gold.json。相关文件速查启动脚本 serve.sh · 服务实现 serve_decide.py · 槽位与读出配置 judge_config.json · 温度校准 calibration.json · 决策头 adapter_vllm/ · 基准报告 reports/decision_index_adaptive.json【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考