GEV-26B-Decide 实战:noul、score、choice 三种决策类型的正确用法

发布时间:2026/10/8 13:15:45
GEV-26B-Decide 实战:noul、score、choice 三种决策类型的正确用法 GEV-26B-Decide 实战noul、score、choice 三种决策类型的正确用法【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-DecideGEV-26B-Decide 是一个基于 Gemma-4-26B-A4B-it 的决策模型它不生成回答而是对 noul是否判断、score0–5 打分、choice多选项选择三种问题直接输出每个选项的校准概率。本文带你快速掌握这三种决策类型的正确用法、POST /v1/decide接口的关键参数以及最容易踩的坑让决策服务一次跑通。30 秒认识 GEV-26B-Decide 决策模型 这套权重包含两个系统共用同一个 vLLM 引擎系统做什么输出System 1一次前向传播完成类型化决策yes/no、2–256 选 1、0–5 评分支持文本和图片每个选项的校准概率自适应思考thinking: autoSystem 1 先行置信度低于阈值默认 0.8时 System 2 参与推理两者等权混合后的校准概率System 1 单次决策约45 msB200 实测256K 上下文同一套权重同时处理文本与图像。决策头把 24 个槽位分给三种类型noul占 2 个、score占 6 个、choice占 16 个槽位布局见 judge_config.json。三种决策类型总览noul、score、choice 怎么选字段noulscorechoice问题形态是/否布尔0–5 分打分从 2–256 个选项中选一个选项固定为[false, true]固定为[0…5]你自定义的字符串列表是否支持thinking✅❌会返回 400 错误✅典型场景意图判断、风控拦截、合规校验情感/质量/满意度评分意图分类、工具路由、多选题一句话原则答案是二选一就用noul需要量级就用score开放式候选就用choice。三步启动下载模型并拉起决策服务hf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide bash GEV-26B-Decide/serve.sh # vLLM 起在 :8000需要 ≥80 GB 显存的 GPUserve.sh 会启动 serve_decide.py标准 vLLM OpenAI 服务 一个POST /v1/decide决策路由。它加载骨干模型一次——普通请求走 System 2OpenAI 端点决策请求走 LoRA 模块jev-decision即 System 1来自 adapter_vllm/。注意需要带 Gemma-4 支持的 vLLM 版本并应用补丁 patches/vllm-gemma4-lm-head-lora.patch。发一个最简请求验证服务curl localhost:8000/v1/decide -H Content-Type: application/json -d { kind: noul, state: Customer says the parcel arrived damaged and wants their money back., question: Is the customer asking for a refund?}响应核心字段options、probabilities与选项一一对应、choice、choice_index、usage请求过thinking时还有thinking信息块。GET /v1/decide/info可随时查看服务端默认值。noul 用法是否判断与意图识别noul即 yes/no 判断服务端固定返回false与true两个概率不需要传 options{ kind: noul, state: John was born on 29 February 1996., question: Was Johns 7th birthday celebrated on a 29 February? }它是客服路由、风控规则判断的主力。若问题偏推理加thinking: auto让 System 1 在置信度不足时自动唤起推理——例如自适应模式下 AQuA-RAT 数学题从 68.1% 提升到 89.0%验证数据汇总见 reports/decision_index_adaptive.json。score 用法0–5 分打分score让模型输出 0–5 六个档位上的概率分布适合情感极性、服务满意度、内容质量这类量级任务。⚠️最容易踩的坑score不支持思考。在 serve_decide.py 中kind为score时对thinking: auto/on的请求会直接返回 400thinking is supported for noul and choice。如果需要先推理再打分请改用noul/choice或走 System 2 聊天端点。choice 用法2–256 个选项的选择choice把候选项交给模型挑一个curl localhost:8000/v1/decide -H Content-Type: application/json -d { kind: choice, state: A bat and a ball cost $1.10 in total. The bat costs $1.00 more than the ball., question: How much does the ball cost?, options: [$0.10, $0.05, $1.00, $0.55], thinking: auto}关键机制与参数≤16 个选项一次前向读取训练过的 A–P 标签最快路径。16 个选项默认strategy: tournament——按组并行每组 ≤16再决出 16 名决赛所有选项都被读取、无剪枝。备选single单遍约 3 倍快但精度略降、permute4 种选项顺序取平均。实测能力150 个意图的 CLINC150 分类准确率达95.5%255 选项混合意图集 89.0%。读取响应与置信度校准拿到probabilities后不要只看 argmax要用概率做置信度门控默认温度来自 calibration.jsonnoul1.003 /choice1.017 /score0.999。若你的自动化动作依赖置信度阈值如概率 0.95 才自动执行建议改用对真实答案校准的 calibration_gold.json。请求时加debug: true可拿到 System 1 / System 2 的原始分布便于排查。避坑清单高频错误一次说清 坑说明给score传thinking直接 400score只走 System 1noul/score传自定义 options只接受固定选项[false,true]/ 0–5分类/检索任务开thinking: auto帮助很小甚至有害BANKING77 macro-F1 从 88.0 掉到 85.0推理题才开工具路由/意图分类保持off高并发下思考太慢调低threshold或设think_budget思考 token 上限换速度自己调/v1/completions读分布必须显式传top_k: 0、top_p: 1.0否则默认生成配置会截断概率小结noul管二选一score管 0–5 打分不支持思考choice管 2–256 选 1超 16 项默认 tournament 策略。推理类问题加thinking: auto分类/路由类保持off。用概率而非选择本身做置信度门控高置信自动化场景换用 calibration_gold.json。相关文件速查启动脚本 serve.sh · 服务实现 serve_decide.py · 槽位与读出配置 judge_config.json · 温度校准 calibration.json · 决策头 adapter_vllm/ · 基准报告 reports/decision_index_adaptive.json【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询