Atomic Agent Fusion模式实战:云模型规划+本地模型池并行的终极混合编排指南

发布时间:2026/10/3 12:47:24
Atomic Agent Fusion模式实战:云模型规划+本地模型池并行的终极混合编排指南 Atomic Agent Fusion模式实战云模型规划本地模型池并行的终极混合编排指南【免费下载链接】atomic-agentAtomic Agent is a local-first AI agent. Runs open-weight models on your own machine via llama.cpp.项目地址: https://gitcode.com/gh_mirrors/at/atomic-agentAtomic Agent 是一款本地优先local-firstAI Agent其 Fusion 模式实现了「云模型规划 本地模型池并行执行」的混合编排云端模型负责思考与拆分任务跑在 llama.cpp 上的本地模型池负责并行干活让多步长任务的云 token 成本显著下降。 一句话理解Fusion 就是给 Agent 请了一位云架构师带着一队本地施工队云端按 token 计费的钱只花在规划上重复劳动全部交给免费的本地模型。为什么需要Fusion模式单模型的两个成本难题只用一个模型跑 Agent总会碰到两个坑纯本地消费级硬件上跑得起的模型4B~12B 级别独立处理复杂规划时容易翻车任务越复杂失败率越高纯云端Agent 的每一步都会把不断增长的上下文重新过一遍模型长任务的 token 账单会越滚越大。Fusion 模式把这两件事拆开云端模型按思考付费本地模型池免费干活。fusion-delegate.ts 中的原话概括了这个经济学模型——云端的 token 为思考付费本地的 token 为批量劳动付费cloud tokens pay for the thinking, local tokens for the bulk。Fusion模式工作原理云规划本地池并行的分工图一次 Fusion 会话中的分工非常明确而且是由系统强制执行的不是靠提示词请求编排者Orchestrator通常是云端模型。它的职责被严格限定为三件事——读规划所需的只读操作、委托fusion.delegate、回复。写文件、跑命令等一切变更类工具调用会被直接拒绝由 fusion-orchestrator-mode.ts 中的门禁拦截工作者Workers本地 llama-server 上的模型池。编排者调用的fusion.delegate会把每个子任务变成一个一次性 worker 会话fusion-worker-session.ts多个 worker 并行执行结果汇总后回到同一次调用中由编排者审查合并安全边界worker 不能再次委托防止无限扇出、不能联系操作者、不能写记忆或排任务它只在编排者声明的目录范围内拥有写权限。这套编排者只规划、工人只执行的分工写进了每个会话的系统提示词fusion-guidance.ts提示词中甚至还会注入本机的真实能力数据llama-server 请求槽位、单流 tok/s 速度等让编排者能据此决定一次派几个工人。快速上手3步开启Fusion混合编排第1步准备两个不同的提供商Fusion 唯一的硬性规则是两条腿必须是两个不同的提供商。最常见的组合是云端编排 本地 llama-server 工人反过来的本地规划 云端执行也完全合法/runmode swap可随时交换两条腿。本地侧无需手动搭环境管理模式下 CLI 会自动下载 llama.cpp 后端和 GGUF 模型atomic-agent models pull qwen-3.5-4b atomic-agent models use qwen-3.5-4b第2步切换到 Fusion 模式方式一编辑stateDir/config.jsonstateDir默认为~/.atomic-agentllm: { activeTextProvider: openrouter, runMode: { mode: fusion, fusion: { orchestratorProvider: openrouter, workerProvider: local-llama, workers: 3 } } }, localModels: { managed: { parallel: 3 } }方式二在 TUI 中按ctrlr或点击输入框的后端标识选择Where it runs开关的最后一行 Fusion也可用键盘命令/runmode fusion。生效时输入框和聊天气泡会染上橙色标识方便一眼确认模式。第3步选择本地模型池的并行宽度进入 Fusion 后输入框下方多出一个Workers控件快捷键/runmode workers N用于选择 worker 模型和默认扇出宽度。注意本地侧的实际上限由 llama-server 的请求槽位决定即localModels.managed.parallel默认为auto按上下文自动推算多出来的任务会自动排队。关键参数速查本地模型池并行调优手册以下参数都集中在 llm-run-mode-config.ts 中定义按需调整即可参数默认值作用workers21~8默认扇出宽度不是上限编排者可按任务自行要更多cloudWorkers41~32worker 腿在云端时的扇出上限本地腿由槽位限制workerMaxSteps60单个 worker 回合的步骤上限workerTimeoutMs45 分钟单个 worker 的墙钟超时实际会按任务量和实测速度自适应收紧workerReasoning不设置限制 worker 的推理力度low/medium/high避免小模型想太多reviewStallSteps6编排者连续只读不委托超过此值会被催促去委托或回复一个值得注意的细节本地侧的 worker 超时不是固定值worker-runner.ts 会用实测的生成速度tok/s 声明产出文件数动态估算每个 worker 的截止时间真正卡死的 worker 会更快被砍掉、交给编排者重新拆分。一次Fusion任务的真实执行流程以重构一个模块并补全测试为例典型流程是读够决策编排者用只读工具浏览相关文件读操作在 Fusion 中永不被拦截公开规划 同回合委托列出独立的部分一次fusion.delegate调用里每个部分一个任务任务中写清楚产出文件路径和什么算完成扇出并行每个任务在独立的一次性会话里跑完自己的完整回合本地池内多 worker 同时开工TUI 会实时显示每个 worker 的启动与完成审批边界批准一次扇出后worker 只能在任务声明的目录内写文件和跑命令目录外的路径会以needs_orchestrator返回编排者会带上该路径重新发起扇出等你批准更大范围fanout-scope.ts审查合并 返工编排者逐条对照任务简报检查结果不合格的failed、cancelled、质量不够会带着哪里错了、好的样子是什么样再次委托出去而不是自己动手改。性能与成本本地模型池并行为什么划算从官方基准GAIA-L1-EXPERIMENT.md可以看到仅靠同一个本地模型qwen-3.6-35b-a3bAtomic Agent 就在 GAIA Level 1 公开集上拿到69.8% 的准确率、单任务平均约 217 秒。Fusion 在此基础上进一步放大优势规划、整合、评审这些必须聪明的环节交给云端模型而读几十个文件、写样板代码、生成测试这类体力活全部落到本地模型池——这些正是纯云端跑法里最烧 token 的部分。本地 token 免费云端账单只覆盖真正的思考。3个常见坑位与规避方法⚠️坑1编排者一直读、不肯委托云端模型拿着 40 个工具目录时常会自己把文件全读完。Fusion 的解法是双保险提示词引导 reviewStallSteps卡点——连续 6 步只读不委托会被点名催促达到 2 倍阈值后该步骤只剩fusion.delegate、reply、finish三个选项可用见 review-stall.ts。⚠️坑2本地 llama-server 根本没起来比如端口被占用导致守护进程启动失败此时每次扇出的 worker 全部空跑。系统对这种情况很敏感连续 2 次扇出零产出后会直接让编排者停止重试并明确告诉你本地腿没在提供服务去检查 llama-server 日志而不是让它无限循环。⚠️坑3一台 GPU 上塞太多 worker本地 worker 共享一张 GPU 和一份上下文N 个并行大约每个慢 N 倍还可能集体超时。提示词中已内置了这台机器的槽位数和 tok/s 数据编排者被明确告知maxWorkers最好不超过槽位数如果你手动调大了workers记得同步localModels.managed.parallel并重启本地守护进程。延伸阅读相关源码与文档模块说明src/config/llm-run-mode-config.tslocal / cloud / fusion 三种运行模式的全部配置项与校验src/llm/run-mode/resolve-run-mode.ts运行模式解析双腿解析、降级策略src/tools/fusion/fusion-delegate.tsfusion.delegate扇出工具核心实现src/agent/fusion-orchestrator-mode.ts编排者工具门禁强制只规划不执行src/prompt/fusion-guidance.ts注入编排者的 Fusion 行为引导与机器事实src/tools/fusion/worker-runner.tsworker 回合执行、队列与自适应超时README.md完整功能与安装指南写在最后Fusion 模式是本地优先理念的放大器它不要求你把所有智能都塞进一张显卡而是让便宜的本地算力承担大部分劳动昂贵的云端智力只出现在刀刃上。如果你的机器能跑一个 4B 以上的量化模型又对长任务的 token 账单敏感Fusion 值得成为你的默认运行模式。️【免费下载链接】atomic-agentAtomic Agent is a local-first AI agent. Runs open-weight models on your own machine via llama.cpp.项目地址: https://gitcode.com/gh_mirrors/at/atomic-agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询