复现little-coder论文数据:9.7B Qwen在Aider Polyglot拿下45.56%,领先基线2.4倍

发布时间:2026/10/3 20:10:10
复现little-coder论文数据:9.7B Qwen在Aider Polyglot拿下45.56%,领先基线2.4倍 复现little-coder论文数据9.7B Qwen在Aider Polyglot拿下45.56%领先基线2.4倍【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coderlittle-coder 是一个专为本地小参数模型优化的编码智能体coding agent框架。在它的论文数据中9.7B 的 Qwen3.5 模型在 225 道题的 Aider Polyglot 多语言编程基准上平均拿下45.56%而同一模型用原版 Aider 只得到19.11%——框架差距达2.4 倍。这篇教程带你拆解论文数据的生产过程硬件、配置、跑分方法与关键结论新手也能照着复现。一、45.56% 是什么水平先看论文成绩单系统模型Aider Polyglot 成绩little-coder Qwen3.5-9B两次跑分均值9.7B 本地模型45.56%原版 Aider Qwen3.5-9B同权重同协议9.7B 本地模型19.11%GPT-4.5 preview公开基准参考线云端大模型44.9%gpt-oss-120b公开基准参考线云端 120B 模型41.8%一个 8GB 显存笔记本上跑的 9.7B 量化模型追平了云端前沿模型在公开榜单上的成绩——这就是论文标题 Honey, I Shrunk the Coding Agent 的底气。论文级跑分环境全部来自官方报告配置项值CPUIntel Core i9-14900HXGPURTX 5070 Laptop8 GB 显存内存31 GiB模型ollama/qwen3.59.7BQ4_K_M约 6.6 GB推理后端Ollama 0.20.5Docker上下文窗口32,768 tokens思考预算2,048 tokens / 轮温度0.3全程离线、零云端推理一台消费级笔记本就是全部算力。二、一键安装与复现环境准备 第 1 步拿到论文版代码。45.56% 产生于 v0.0.2commit1d62bde复现必须切到该 taggit clone https://gitcode.com/gh_mirrors/li/little-coder cd little-coder git checkout v0.0.2 # 按该版本 README 完成 Python 环境安装第 2 步起本地模型。ollama pull qwen3.5拉取 9.7B 权重保持num_ctx32768与论文一致。第 3 步跑基准。测试驱动脚本在 benchmarks/aider_polyglot.py对 225 道练习逐题起 agent 会话读文件→写代码→跑测试→失败重试一次用各语言原生测试器判分。 每轮完整跑分约20–23 小时。论文数字 45.56% 是两轮46.22% / 44.89%的均值波动仅 ±0.94 pp——建议至少跑两轮再下结论。三、逐语言拆解Python 与 Java 是强项Rust 是硬顶语言题数little-coder原版 Aider差距Python3452.9%17.6%−35 ppJava4752.1%23.4%−28 ppC2650.0%26.9%−23 ppJavaScript4946.9%18.4%−27 ppGo3938.5%12.8%−26 ppRust3030.0%16.7%−13 pp最窄三个值得记住的结论Python 差距最大−35 pplittle-coder 的工作区发现 技能注入在 Python 这种语法简洁、测试驱动的语言上收益最明显。Rust 差距最窄借用检查器是模型能力天花板架构再怎么优化也推不动——9.7B 模型在 Rust 上就是会撞到语义理解的墙。跨语言难度高度一致book-store、bowling等组合优化/状态机题在所有语言下双系统全灭瓶颈在算法推理深度而非语言语法。四、2.4 倍领先从哪来5 个反小模型缺陷机制小模型不是笨而是失败模式高度确定——同一个坑反复踩。little-coder 的思路就是用确定性的架构对策堵确定性的坑。1️⃣ Write-guard读写不变量Write 工具对已存在文件一律拒绝结构化报错强制模型改用 Edit 做局部修改。实测每轮在57% 的练习上拦截过整文件重写——这是开发期观察到的第一大失败模式。2️⃣ 思考预算上限2,048 tokens实时监控推理 token 流超限即截断把已产生的部分思考回注上下文后关闭思考重试。每轮触发约 200 次——意味着大量练习上模型本来会把思考跑到上下文爆炸。3️⃣ 测试输出引导的重试第一次失败后把测试输出喂回上下文再试一次救回17.6%的通过题约 8 pp。4️⃣ 工作区发现 知识注入编码类关键词触发时注入技能卡片指导模型先 Glob 出.docs/instructions.md、README.md再动手。67% 的练习用到了 Glob100% 用到了 Read——先读规范再写代码直接翻盘了 affine-cipher 等具体题目。5️⃣ 质量监控 20 轮上限检测空响应/幻觉工具名/死循环通过的题平均 11.6 轮收敛失败的题烧满 19 轮——41% 的练习触顶被截断而不是无限烧显卡。 机制对应的技能与知识文件见 skills/skills/knowledge/dynamic_programming.md、skills/protocols/research_protocol.md架构总览见 docs/architecture.md。五、时间经济学慢一点但赢面大得多指标little-coder原版 Aider通过题平均耗时176s141s失败题平均耗时491s224s每小时通过题数4.742.75Aider 失败得快2 次全文件重写就放弃但 little-coder 在难题上多探索的那 20 轮换来1.72 倍的通过吞吐。代价是失败题消耗 2.8 倍于通过题的时间——约56% 的总跑分时长花在了最终失败的题上这也是作者提出预测性提前终止优化方向的原因。六、复现避坑清单 论文跑分时踩过的三个坑比数据本身更有参考价值详见 docs/benchmark-reproduction.mdOllama runner 会静默崩溃长跑 6–10 小时后推理子进程死掉被替换崩溃后的语言赛道通过率从 ~52% 掉到 ~32%且不报错。对策每个 API 请求加keep_alive: -1。测试进程必须沙箱化一道 Go 题的 buggy 测试二进制吃掉 27.7 GB 内存拖垮整机。用systemd-run --scope -p MemoryMax4G给每道题套内存上限。别信单次跑分runner 污染、热降频都会系统性压低成绩两轮均值 ± SEM 才是可信口径。七、结论脚手架与模型匹配是小模型的杠杆关键数字含义45.56% vs 19.11%同一 9.7B 权重架构差 2.4 倍69 题little-coder 解出而 Aider 失败的架构增量题净贡献 58 题8 pp仅测试输出重试一个机制的贡献8 GB 显存全部数据的生产硬件想继续深入完整叙事读 docs/benchmark-reproduction.md基线对照读 docs/benchmark-baseline-aider.md后续 35B-A3B 冲上 78.67% 的进阶数据见 docs/benchmark-qwen3.6-35b-a3b.md。给新手的一句话总结模型选不选得动是能力问题但用不用得上是工程问题——little-coder 证明在本地小模型上后者恰恰是你最能发力的地方。【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coder创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询