
Jeff 游戏大测试Doom、Frogger、Pac-Man 零样本表现深度评测【免费下载链接】jeffMillisecond decisions, any domain: a 0.8B open System 1 model that picks between your options with calibrated probabilities. One base, swappable LoRA adapters, on your own hardware.项目地址: https://gitcode.com/gh_mirrors/jeff6/jeffJeff 是一款 0.8B 参数的开源System 1快速决策模型单次前向传播就能在多个选项中做出带校准概率的毫秒级选择无需生成任何文本。本文用 Doom、Frogger 和 Pac-Man 三款经典游戏对它做零样本模型从未见过这些游戏表现的深度评测并附上完整复现方法。Jeff 是什么一个只做选择题的 0.8B 小模型工作方式你用大白话描述局面并列出选项Jeff 一次前向传播返回每个选项的概率和置信度——没有生成文本没有解析。速度是核心卖点0.8B 基座在 NVIDIA GPU 上单次决策中位约 22 毫秒、Apple M4 Max 上约 28 毫秒这是它能实时打游戏的前提。下图展示了 Jeff 各版本基座在 5 个公开基准上的决策准确率0.8B 与 2B 模型基本打平并接近已发布的 Jev说明小尺寸并没有牺牲做选择的能力。零样本游戏测试方法纯文字输入 两条基线游戏测试的设计非常干净适合新手理解模型能力边界玩家永远看不到像素。代码把局面翻译成文字血量、怪物距离与方位角、棋盘格子把合法操作变成选项Jeff 每回合只回答一道选择题Doom 每 4 个游戏 tick 决策一次。两个陪练基线随机玩家随便选一个合法动作和手工规则机器人把策略写死成代码后者是必须达到的及格线。固定 20 局、种子 1234保证每次评测可复现第一局会录成视频字幕实时显示每个选项、模型给出的概率、最终选择和耗时见 video.py。多种措辞风格可切换rule把正确条件直接写进选项如方位角在 -8 到 8 之间就该开火judgement选项只说按钮的作用outcomes/situation则让代码把结果用文字算好给模型挑。测试入口在main.py。Doom 测试只看文字就能瞄准开火Doom 使用 ViZDoom 的 defend_the_center 场景。每回合代码算出最近怪物的距离和方位角0 正前方正数在左侧、负数在右侧Jeff 在 3 个按钮中做选择ATTACK开火、TURN_LEFT、TURN_RIGHT。rule 措辞直接给出瞄准阈值见 doom.pyFire. Correct whenever the nearest monsters bearing is between -8 and 8...20 局平均击杀数种子 1234随机玩家0.75手工规则机器人6.55Jeff零样本6.55—— 与手工策略完全打平对照参考Jev 在同一测试台架上的已发布成绩为 6.55rule 版/ -0.60judgement 版Jev 是 API 模型每次调用含网络延迟 114–212 毫秒而 Jeff 在本地约 22 毫秒。想更直观地看怪物在哪个方位时 Jeff 会按哪个按钮一条命令即可统计诊断脚本 doom_diag.py 会在规则机器人的局面上收集 Jeff 的选择分布。Frogger 与 Pac-Man 成绩10.3 次过河与 57 颗豆子Frogger9 格宽的自实现棋盘3 条生命每局上限 300 步。规则是车在格子上会被撞死河里必须踩在随波漂走的原木上。Jeff 零样本拿下 10.3 次过河与规则机器人打平实现见 frogger.py。Pac-Man98 颗豆子、2 个会主动追人的幽灵、3 条生命、每局上限 600 步。Jeff 吃到 57 颗规则机器人 94 颗。差距的原因很清楚吃豆子需要绕开幽灵 规划路线的较远视野这正是 0.8B 小模型不擅长的多步推理实现见 pacman.py。配套工具pacman_diag.py 会统计 Jeff 所选选项的危险/食物分布以及它选反向的频率单元测试 test_games.py 保证规则机器人稳定胜过随机这条基线成立避免测试本身出错。三场游戏成绩单随机、规则机器人与 Jeff 对比游戏指标随机玩家规则机器人Jeff零样本Doom平均击杀 / 局0.756.556.55Frogger平均过河次数 / 局—10.310.3Pac-Man吃到豆子—94 / 9857 / 98结论一目了然看当前局面执行一步的任务0.8B 零样本就达到了手工策略水平需要跨多步规划的任务则明显拉开差距——这和它直觉式的定位完全吻合。对比案例微调之后的 Jeff 能下国际象棋游戏测试是零样本的那微调后呢官方示例用 60 万个 Lichess 局面在单张 GPU 上训练约 3.5 小时1000 个留出谜题零样本 15.5% → 微调后55.8%约 1000 Elo无任何搜索因为每步只是一次前向传播单卡可同时跟上约 600 盘闪击棋全部脚本见 examples/chess/如何复现 Jeff 游戏测试三步跑通全套脚本git clone https://gitcode.com/gh_mirrors/jeff6/jeff cd jeff uv sync --extra games # 安装 vizdoom / imageio见 [pyproject.toml](https://link.gitcode.com/i/6b867aae759a5c8a8cb3a33b9badd4be) # 先按 README 启动 jeff-serve 服务再运行 uv run python -m jeff.games --game frogger --player jeff \ --url http://127.0.0.1:8765 --criteria rule --out runs/games/frogger.json不想逐条敲命令一键跑完全部 5 组测试Doom × 3 种措辞 Frogger Pac-Manscripts/games_all.sh。结果 JSON 会记录每局得分、决策总数和单决策中位耗时方便画进 dashboard.html 的游戏对比面板。评测结论这套游戏测试到底说明了什么✅零样本泛化模型从未见过这些游戏只靠读文字局面 在选项里挑就追平手工策略Doom、Frogger。✅决策成本极低单步约 22 毫秒游戏可以按实时速度运行还能同屏跑成百上千局。✅概率是校准的视频字幕里能直接看到每个选项的概率多自信是透明可查的。⚠️边界也很清晰0.8B 不做多步推理Pac-Man 的 57 对 94 就是证据。一句话总结如果你的场景是描述局面、列出选项、快速选一个——比如分类、路由、告警分诊——Jeff 的这套游戏测试就是它能力边界的最佳预览。【免费下载链接】jeffMillisecond decisions, any domain: a 0.8B open System 1 model that picks between your options with calibrated probabilities. One base, swappable LoRA adapters, on your own hardware.项目地址: https://gitcode.com/gh_mirrors/jeff6/jeff创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考