
「漫说测试」风向观察 · 第 5 期第 1 期讲了单个 Agent 怎么评测第 4 期讲了它调的工具MCP怎么测。 这一期架构又往上走了一层AI 从一个人干活变成了一队人协作——多个 Agent 分工、交接、互相调用。 而海外测试圈最近在反复强调一个反直觉的事实你把每个 Agent 单独测到满分整个系统照样会崩。【贴图1】一、先看一件事单测全绿系统照崩先理清一条逻辑链。前面几期我们聊的都是**“单 Agent 视角”**一个 Agent 能不能理解任务、会不会调对工具、抗不抗得住攻击。这些当然要测。但现在越来越多的系统是多 Agent 架构一个调度 Agent拆任务一个检索 Agent找资料一个写作 Agent出内容一个审核 Agent把关——它们通过交接handoff串成一条链^1。于是问题来了我们习惯的逐个测 Agent的方法在这里失效了。因为你测的是每个零件合格可系统崩不崩取决于零件之间怎么配合。这就像四个人各自技术顶尖凑成一个球队却踢得一塌糊涂——问题不在个人在协作。这就是本期要讲的核心多 Agent 系统的 bug主要不在 Agent 内部而在 Agent 之间。二、风向一bug 藏在协作层而且会级联放大海外的数据很直接。有分析指出多 Agent 系统在生产环境中的失败率高达 41%–86.7%并从中归纳出14 类典型的失败模式^2。这些失败模式几乎没有一个是单个 Agent 自己坏了而是集中在协作层^3交接失败handoff failureA 把任务交给 B意图丢了、上下文丢了、格式对不上——链条在接口处断掉^4协调死锁deadlock两个 Agent 互相等对方或者绕圈重复劳动任务永远推进不下去^3涌现行为emergent behavior单个 Agent 都正常但凑在一起产生了谁都没设计过的行为——可能是低效也可能是危险^3。更狠的是级联失败cascading failure一个 Agent 产生了一个错误哪怕是幻觉这个错误变成了下游 Agent 的输入——下游信了再往下传错误被一层层放大最后变成一个系统级事故^5。一句话单个 Agent 幻觉是个小毛病一个幻觉喂给五个下游 Agent就是一场雪崩。而这恰好是逐个测 Agent的方法永远发现不了的东西。三、风向二方法上要测三层而不是一层那多 Agent 系统该怎么测海外给出的一致答案是分层测而且必须覆盖协作这一层^1。第一层单个 Agent。每个 Agent 自己的行为、工具调用、输出质量——对应我们前几期讲的那套评测、红队、MCP 测试。第二层每一次交接handoff。这是多 Agent 特有的、也是最重要的一层A 交给 B 的时候意图、上下文、格式、约束有没有完整、准确地传过去交接处失真后面全废^4。第三层整体编排 压力。把整条链跑起来加并发、加异常、加超时——看它会不会死锁、会不会级联崩、会不会涌现出没设计过的行为^1。关键洞察大部分团队只测了第一层就以为系统测过了。而多 Agent 真正的风险全压在第二、三层——这正是测试人最该补上的地方。四、风向三失败往往起于规格不清而不是技术不强还有一个被海外反复强调的点多 Agent 系统失败多半不是基础设施不行而是规格模糊 协调断层^6。翻译一下不是因为模型不够聪明而是因为没人把’每个 Agent 该干什么、交接什么、边界在哪’说清楚。这就有意思了——因为它把问题从AI 难题拉回到了测试难题定义清晰的标准、明确每个环节的输入输出、把隐含假设显式化——这不正是测试人天天在做的事吗第 2 期讲 Vibe Coding 时我们说过要先定意图和契约这里是同一个道理。所以海外给出的对策也很测试味确定性的任务分配、清晰的层级目标拆解、以及贯穿全程的可观测性^7。尤其是可观测性observability——因为多 Agent 的失败是跨 Agent 的时间线你必须能看到每一次交接、每一个决策、每一段上下文才定位得到问题^8。这就像我们做分布式系统的链路追踪看不见链路就查不出故障。五、一个结论单 Agent 评测会漏因为协作问题不在单个 Agent 身上把上面的逻辑收成一句用逐个测 Agent的方法去测一个多 Agent 系统天然会漏掉最大的一类风险——协作层的失败。^2这不是测得更努力就能解决的而是测试的对象和层级变了你的被测单元从一个 Agent变成了Agent 与 Agent 之间的那条链路。对测试人来说这其实是个熟悉又陌生的局面熟悉的是——交接、契约、链路、级联、链路追踪这些在微服务/分布式测试里我们早就玩过陌生的是——这次的服务是会自己理解、决策、幻觉的 AI。结论很清楚多 Agent 测试是分布式系统测试的功底加上AI 不确定性的新变量。会做分布式测试的人天然有一半优势。六、给国内测试人的 3 条落点【贴图9】**1. 把交接当被测点单独写用例。**别再只测单个 Agent。针对每一次 handoff专门设计用例意图有没有丢上下文全不全格式对不对边界说清没有交接处就是最容易断的地方^4。2. 主动构造级联用例别等它自己崩。**故意注入一个错误一个幻觉、一个超时、一个脏数据看它会不会沿链路放大**——这叫混沌测试的思路用在多 Agent 上照样成立^5。**3. 先把可观测性搭起来再谈定位。**多 Agent 的问题横跨时间线没有 trace谁在什么时候把什么交给了谁你连复现都做不到。把链路追踪和决策日志建起来才能从系统崩了走到交接在这断了^8。一句话单 Agent 时代你测的是人多 Agent 时代你测的是配合。而测配合本来就是测试人的主场。【贴图10】 彩蛋我把这一整套「多 Agent 系统测试」资料整理成了资源包三层测试法落地指南 14 类协作失败模式清单 级联失败检测方法 可观测性/trace 实践全部附直达链接。参考来源海外[^1] ContextQA《How to Test Multi-Agent Systems: A Practical Guide》https://contextqa.com/blog/how-to-test-multi-agent-systems/[^2] Prefactor《Multi-agent coordination failures: why per-agent evals miss the real risks》https://prefactor.tech/blog/multi-agent-coordination-creates-new-reliability-and-evaluation-requir[^3] Galileo《Why Multi-Agent AI Systems Fail and How to Fix Them》https://galileo.ai/blog/multi-agent-ai-failures-prevention[^4] QAwerk《Testing Multi-Agent AI Systems: Catch Handoff Failures Early》https://qawerk.com/blog/testing-multi-agent-ai-systems/[^5] Adversa《Cascading failures in agentic AI: the OWASP ASI08 guide》https://adversa.ai/blog/cascading-failures-in-agentic-ai-complete-owasp-asi08-security-guide-2026/[^6] Augment Code《Why Multi-Agent LLM Systems Fail and How to Fix Them》https://www.augmentcode.com/guides/why-multi-agent-llm-systems-fail-and-how-to-fix-them[^7] Splunk《Multi-Agent Coordination: 10 Strategies to Prevent System Failures》https://www.splunk.com/en_us/blog/artificial-intelligence/multi-agent-coordination-strategies.html[^8] Zyrix《Multi-Agent AI Testing Guide 2026》https://zyrix.ai/blogs/multi-agent-ai-testing-guide-2026/