
小罗碎碎念文献来源Schmidgall S, Ziaeifard R, Harris C, et al. AgentClinic: a multimodal benchmark for tool-using clinical AI agents.npj Digital Medicine(2026) 9:499. Published online: 27 April 2026. DOI: 10.1038/s41746-026-02674-7. 作者单位约翰斯·霍普金斯大学、斯坦福大学、苏黎世联邦理工学院等。过去几年医学领域对大语言模型LLM的评价几乎全部建立在静态选择题之上——MedQA、MedMCQA、PubMedQA这些知名基准本质上都是给模型一段病历摘要让它从四个选项里挑一个最可能的诊断。可现实中的临床诊疗是什么样的病人坐在你对面话说一半症状描述模糊不清你需要一边问病史、一边安排检查、一边权衡可能性在信息不完整的情况下一步步摸清患者真实状况。今天和大家分享的这篇文章构建了一个名为AgentClinic的多模态智能体仿真基准在一个虚拟诊室里有扮演医生的AI、有扮演病人的AI、有负责出具检查报告的AI还有一个当裁判的AI。医生不能直接看到答案必须像真实临床一样通过与病人对话、调取检验结果、查阅医学文献最终给出诊断。虚拟诊室的完整运转流程下图左侧的工作流程图里身穿白大褂的Doctor是被考核的主角它从Start Simulation启动后会在三条路径之间来回切换与Patient进行History and QA也就是问诊对话向Measurement检查智能体发出Medical Scan Request也就是开化验单或影像检查在信息足够后做出Diagnosis/Next Steps判断与此同时Doctor还可以随时向外部的Agent Tools工具箱发起Tool Request——比如调取PubMed文献、查阅教科书或者使用做笔记、反思推理等认知工具——工具返回结果后通过Receive Tool环节回流给Doctor形成一个持续循环的决策闭环。整场模拟的终点由Moderator裁判智能体把关它把Doctor给出的最终诊断与Ground Truth Diagnosis标准答案比对绿色对勾代表诊断正确红色叉号代表误诊一场虚拟门诊就此结束。MedX知识岛看完一篇好论文下一步该做什么找代码、查数据还是尝试复现在MedX知识岛既有医学AI领域最新的顶刊复现也有最全面的公开代码和数据库查询系统注册登录即可免费探索让医工交叉领域的前沿探索不再为代码和数据所困一、四个AI角色如何模拟一场真实门诊整个仿真系统由四个智能体Agent协作构成严格按照实际临床场景去设计。病人智能体病人智能体掌握着一份预先设定好的症状和病史但它不知道正确诊断是什么它的任务就是演好一个真实患者——回答医生的问诊偶尔含糊其辞偶尔添油加醋。医生智能体医生智能体是被考核的主角它拥有医学常识但必须通过问诊和检查来逐步缩小诊断范围它可以向病人提问也可以向检查台发出指令。检查智能体检查智能体扮演着检验科和影像科的角色当医生开具心电图或血常规时它会根据预先设定好的患者病理背景返回一份真实可信的检查报告——比如一位疑似心梗的病人心电图会显示ST段抬高心肌酶会升高。裁判智能体裁判智能体则是终极大boss它手里握着标准答案等医生给出最终诊断后判定是对还是错。这四个角色之间的交互有严格的规则一场问诊最多进行20轮对话每轮医生只能问一个问题或开一项检查。这意味着医生不能一口气把所有可能的检查全做了必须像真实临床一样在有限时间内做出有优先级的决策。论文特别指出这种有限交互轮次的设计至关重要——当交互轮次从20轮减少到10轮时Claude 3.5 Sonnet的诊断准确率从40.8%骤降到25%减少到15轮时也降至38%。换句话说AI医生也会慌——时间越紧越容易误诊。更有意思的是AgentClinic还给医生智能体配备了一整套工具箱Toolbox模拟真实医生可以使用的各种辅助手段。这套工具箱包含六件工具零样本思维链Zero-Shot CoT让模型一步一步推理不看任何例子单样本思维链One-Shot CoT给一个范例再让它模仿自适应检索增强生成Adaptive RAG又分网页版和教材版让模型像医生查PubMed或翻开教科书一样实时检索医学文献笔记本Notebook允许模型在问诊过程中做笔记、写草稿这些笔记会跨对话保留下来反思思维链Reflection CoT让模型在给出诊断前先自我反思。论文发现工具的使用效果因模型而异Notebook工具让Llama 3-70B的诊断准确率从5.3%飙升至15.3%——相对提升高达92%。这就像给一个记忆力不好的实习生一支笔和一沓病历本他突然就从一问三不知变成了有条不紊。二、对11个主流大模型进行临床考核AgentClinic的论文没有停留在造了一个benchmark就结束它用这个新考场对11个主流大语言模型进行了一次全面临床考核。第一组实验MedQA的考场版 vs AgentClinic的门诊版。研究人员把原来MedQA考试里的选择题改造成了需要医生智能体通过问诊逐步获取信息的交互式任务。在原版MedQA中GPT-4o的准确率高达89.8%Claude 3.5 Sonnet也有89.1%。但到了AgentClinic-MedQA里同样的模型们集体翻车Claude 3.5 Sonnet降到42.9%GPT-4o降到47.3%GPT-4降到35.2%而开源的Llama 3-70B只有3.1%。论文用一张对比图直观展示了这个断崖式下跌MedQA上准确率接近90%的模型在交互式诊断中准确率可能不足原来的十分之一。更值得玩味的是论文明确指出MedQA上的准确率并不能预测AgentClinic上的表现——一个模型在选择题考试里考得好跟它在真实问诊里能不能做出正确诊断几乎是两码事。第二组实验让AI医生带偏见看病。这是AgentClinic最引人深思的部分。研究人员在患者和医生智能体的提示词里植入了23种偏见分为认知偏见和隐性偏见两大类。认知偏见包括近因效应医生刚看了一个类似病例就倾向于先入为主、“确认偏误”只找支持自己初步判断的证据、“虚假共识”认为大多数人都跟自己想法一样等隐性偏见则包括性别、种族、年龄、性取向、社会经济地位等刻板印象。结果发现这些AI医生在面对植入了偏见的场景时诊断准确率出现了可测量的下降GPT-4在存在隐性偏见时平均准确率从48%降到37%绝对下降11%在存在认知偏见时从52%降到32%绝对下降20%。更有意思的是论文还让AI患者在看完病后给自己的医生打分——包括信任度、依从性和复诊意愿。隐性偏见尤其严重地降低了患者的信任度和复诊意愿其中性别偏见对患者依从性的打击最大下降7分而教育偏见在所有三类患者评价指标上都有显著负面影响。这意味着AI医生不仅会误诊还会在不经意间得罪自己的患者——而且它自己完全意识不到。第三组实验多语言、多专科、多模态的全面承压测试。AgentClinic的覆盖面远比一般基准广泛。在多语言维度上测试覆盖了英语、西班牙语、法语、印地语、韩语、波斯语和中文共7种语言。Claude 3.5 Sonnet在所有语言中表现最为稳健平均准确率48.4%而GPT-4o在中文场景中准确率高达40.4%在日语中则从11.21%波动到35.5%。在专科维度上9个专科的难度差异巨大普通内科76.3%和老年科74.3%对模型来说相对友好而急诊医学41.9%、精神病学和眼科学52%则困难得多——论文推测这可能是因为急诊场景信息极度碎片化而精神科诊断本身就高度依赖对话中的细微线索。在多模态维度上研究人员引入了《新英格兰医学杂志》NEJM的病例包含X线、CT、MRI和病理切片图像让医生智能体通过请求查看影像来辅助诊断。结果发现让模型主动看图比一开始就把图像塞给它效果更好Claude 3.5 Sonnet在主动请求影像后准确率从27.7%提升到35.2%。这恰好印证了真实临床中的规律——影像科报告要主动申请才有价值一股脑把所有片子甩给医生反而会让他抓不住重点。三、从模拟诊室到真实临床Schmidgall团队的这项工作其价值远不止于又造了一个benchmark。它系统地揭示了一个长期被掩盖的事实医学大语言模型的临床能力被静态选择题考试严重高估了。当模型必须在信息不完整、时间有限、需要主动获取证据的真实诊疗场景中做决策时它的表现会出现断崖式下跌——而这恰恰才是临床AI需要面对的真实战场。这种认知扭转带来的直接影响是深远的它意味着未来医学AI的评价体系不能再只看MedQA分数了。论文明确建议评估一个模型的临床能力必须把它放在交互式环境中让它面对不同背景的患者智能体在有偏见、有时间压力、需要调用工具的复杂场景中接受考核。从更长远的视角看AgentClinic让我们可以系统地研究工具使用对医学AI的影响。论文发现配备Notebook工具的Llama 3-70B实现了92%的相对提升而自适应检索让GPT-4o在需要查阅文献的病例中表现最佳。这说明一个医学AI模型的能力上限不完全取决于它的参数量而取决于它会不会用工具——就像一个再好的医生不会开化验单、不会查文献也无法在复杂病例中做出正确判断。这个发现对未来医学AI的设计方向具有直接指导意义与其盲目追求更大的模型不如教会模型如何像真正的临床医生一样思考——问对的问题、开对的检查、查对的文献、在信息不完整时做出合理判断。当然AgentClinic本身也承认了它的局限。仿真环境终究是仿真患者智能体由大语言模型扮演它的反应模式可能无法完全复现真实人类患者的复杂性裁判智能体的判断也可能存在LLM自身的偏见测试集规模3名人类医生作为参照还相对有限。但正如论文在结语中所说这项工作的目的不是给出最终结论而是打开一个新的研究方向——让医学AI从刷榜真正走向临床验证。MedX知识岛看完一篇好论文下一步该做什么找代码、查数据还是尝试复现在MedX知识岛既有医学AI领域最新的顶刊复现也有最全面的公开代码和数据库查询系统注册登录即可免费探索让医工交叉领域的前沿探索不再为代码和数据所困