18760道决策问题:NanoJev端到端训练管线新手指南,从数据构建到混合任务SFT

发布时间:2026/10/4 23:59:09
18760道决策问题:NanoJev端到端训练管线新手指南,从数据构建到混合任务SFT 18760道决策问题NanoJev端到端训练管线新手指南从数据构建到混合任务SFT【免费下载链接】NanoJevA nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline.项目地址: https://gitcode.com/gh_mirrors/na/NanoJevNanoJev 是一个 0.6B 的并行决策模型输入游戏状态与问题直接输出完整候选动作概率分布无需生成任何答案 token。本文带你走通它的端到端训练管线——从 18,760 道决策问题的数据构建到混合任务 SFT监督微调再到 548 例冻结基准的评测看一个小型模型如何同时学会玩迷宫、贪吃蛇和两款 ViZDoom 射击任务 。一、NanoJev 是什么并行决策 动态候选NanoJev 是 Jev 的微型复刻版核心设计只有两条并行决策把多个独立的状态、问题、候选路径放进同一次 backbone 前向计算一次拿到所有答案动态候选每道题可以给出 2~255 个候选动作模型用共享评分头 softmax 返回整个候选集合的概率分布。底座是 Qwen3-0.6B 加一个自定义决策头比常规 LLM 少掉了逐字生成答案这一步输出即概率可直接用于排序、贪心或采样。二、18,760 道决策问题数据构建四步走整个数据集围绕四个任务构建每条数据都是(状态, 问题, 候选集, 目标分布)四元组任务五个分区合计训练分区监督来源ViZDoom Predict Position11,1736,788Sonic Doom 视觉专家策略ViZDoom Basic5,1603,054APPO 专家采集Maze1,469653既有动作标注Snake958403既有动作标注每种版本合计18,76010,898—构建流程可以分为四步采集专家轨迹用 Sonic Doom 的视觉专家CNN GRU纯 RGB 输入在双同步 ViZDoom 实例中跑896 局、17,498 个决策记录真实动作概率分布与终局结果采集脚本为 scripts/sonic_predict_data.py准备混合数据scripts/prepare_sonic_supervision.py 保留原有 Maze、Snake、Basic 行的逐字节原样只替换 Predict Position 行产出 hard专家 argmax 动作与 soft专家完整分布两个版本划分五个分区train、dev、calibration、test、OOD 严格按场景/种子组隔离同一环境组不跨分区OOD 分区还会改变决策节奏每 8 tick 一步以测试泛化目标有效性过滤训练分区 10,898 条中有 10,893 条通过校验11 条不合格问题被隔离而非静默丢弃。三、混合任务 SFT一个模型训练四款游戏数据就绪后训练入口是 scripts/train_unified_games.py完整协议见 docs/SONIC_PREDICT_POSITION.md。关键设定任务平衡权重每次更新固定按1/3、1/3、1/6、1/6混合 Maze、Snake、Basic、Predict Position权重与语料大小无关避免大任务淹没小任务损失函数完整问题上的分类交叉熵-Σ target(a)·log policy(a)把 20 个候选拆成 20 个二分类是明确禁止的四组对照实验hard/soft 目标 × backbone 学习率 1e-5/2e-5全部跑满 600 步、种子 17、相同采样顺序完整配置冻结在 configs/sonic_unified_sft_v1.json热启动训练从既有 Basic 监督 checkpoint 开始BF16 前向 梯度检查点单卡即可完成。四、只用 dev 选 checkpoint548 例冻结基准验收这是整条管线最防作弊的一环臂内选择每个实验臂用开发集加权交叉熵选最优 checkpoint臂间选择在 146 局开发对局上比加权回合成功率选择文件在测试评测前就已写盘最终评测NanoJev、Jev、未微调 Qwen 三方跑同一批548 个冻结案例274 test 274 OOD相同观察接口、相同候选动作、相同 epsilon0.1 控制器与采样种子全部 2,192 局通过独立模拟器重放。最终选中的是hard_lr1e5实验的第 400 步 checkpoint即发布版本unified-games-v1。五、结果小模型追平甚至反超模型MazeSnakeBasicPredict PositionNanoJev混合专家 SFT4/108/8128/12827/128Jev7/108/856/12811/128未微调 Qwen3-0.6B2/100/856/12811/128这一轮训练把 Predict Position 从 11/128 提升到27/128McNemar p0.009Snake 升到 8/8Basic 保持满分 128/128——而 Jev 在这两项只拿到 56/128。更多细节见 docs/SONIC_PREDICT_POSITION_RESULTS.md 和 results/sonic_sft_v1_summary.json。六、新手上手路径git clone https://gitcode.com/gh_mirrors/na/NanoJev cd NanoJev python -m pip install -r requirements-toy.txt建议按这个顺序阅读代码与文档输入契约与问题类型docs/TYPESAFE_CONTRACT.md端到端管线与命令research/pipeline_runbook_zh.md统一游戏环境与 rollout 流程docs/UNIFIED_GAMES.md训练脚本scripts/train_unified_games.py、scripts/run_sonic_supervision.py冻结案例清单configs/unified_games_v1_cases.jsonl一句话总结NanoJev 用 18,760 道结构化决策问题 严格分区 固定权重的混合 SFT把数据构建 → 训练 → 选择 → 评测做成了完全可审计的管线。它的启发是——小模型要赢不靠更大的网络而靠更干净的数据和更诚实的选择协议。【免费下载链接】NanoJevA nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline.项目地址: https://gitcode.com/gh_mirrors/na/NanoJev创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询