ReAct:在语言模型中协同推理和行动

发布时间:2026/10/11 5:40:57
ReAct:在语言模型中协同推理和行动 2022年11月8日本文由谷歌研究院脑团队的学生研究员姚顺宇和研究科学家曹媛发布近年来语言模型LM的应用范围不断扩大涵盖了下游任务。一方面现有的语言模型在适当的提示例如通过思维链下展现出涌现能力能够执行自条件推理轨迹从问题中推导出答案并在各种算术、常识和符号推理任务中表现出色。然而在思维链提示下模型缺乏对外部世界的感知而是依赖自身的内部表征来生成推理轨迹这限制了其反应式探索、推理或更新知识的能力。另一方面近期的研究利用预训练的语言模型在各种交互环境例如文本游戏、网页导航、具身任务、机器人中进行规划和行动重点在于通过语言模型的内部知识将文本上下文映射到文本动作。然而这些模型无法对高层目标进行抽象推理也无法维持工作记忆以支持长远的行动。在《ReAct语言模型中推理与行动的协同作用》一文中我们提出了一种结合推理和行动技术的通用范式使语言模型能够解决各种语言推理和决策任务。我们证明在构建更大规模的语言模型和微调较小的语言模型时ReasonAct(ReAct) 范式均系统性地优于仅使用推理或行动的范式。推理与行动的紧密结合也展现出与人类思维相符的任务解决路径从而提升了模型的可解释性、可诊断性和可控性。模型概述ReAct 使语言模型能够以交错的方式生成语言推理轨迹和文本动作。动作会从外部环境下图中的“Env”获得观察反馈而推理轨迹则不会影响外部环境。相反它们通过推理上下文并更新有用信息来影响模型的内部状态从而支持未来的推理和行动。以往的方法促使语言模型LM生成自条件推理轨迹或特定任务动作。我们提出了ReAct一种结合了语言模型推理和动作两方面进展的新范式。ReAct 提示我们重点关注这样一种设置使用少量上下文示例提示冻结的语言模型PaLM-540B以生成特定领域的操作例如问答中的“搜索”和房间导航中的“前往”以及自由形式的语言推理轨迹例如“现在我需要找到一个杯子并把它放在桌子上”以解决任务。对于以推理为主要任务的任务我们交替生成推理轨迹和动作使任务解决轨迹包含多个推理-动作-观察步骤。相反对于可能涉及大量动作的决策任务推理轨迹只需稀疏地出现在轨迹中最相关的位置即可因此我们编写包含稀疏推理的提示并让语言模型自行决定推理轨迹和动作的异步出现。如下所示有各种类型的有用推理痕迹例如分解任务目标以创建行动计划注入与任务解决相关的常识知识从观察中提取重要部分在保持计划执行的同时跟踪任务进度通过调整行动计划来处理异常情况等等。推理与行动之间的协同作用使该模型能够进行动态推理以创建、维护和调整高级行动计划行动的推理同时还能与外部环境例如维基百科互动将其他信息纳入推理行动的推理。ReAct 微调我们还探索了使用 ReAct 格式轨迹来微调较小的语言模型。为了减少对大规模人工标注的需求我们使用 ReAct 提示的 PaLM-540B 模型来生成轨迹并使用任务成功的轨迹来微调较小的语言模型PaLM-8/62B。本文比较了四种提示方法(a) 标准提示(b) 思维链提示仅推理(c) 仅行动提示以及 (d) ReAct 提示用于解决HotpotQA问题。文中省略了具体情境示例仅展示了任务轨迹。ReAct 提示能够检索信息以支持推理同时利用推理结果来确定下一步检索的内容展现了推理与行动的协同作用。结果我们对 ReAct 和最先进的基线模型在四个不同的基准测试中进行了实证评估问答HotPotQA、事实验证Fever、文本游戏ALFWorld和网页导航WebShop。对于 HotPotQA 和 Fever在模型能够访问维基百科 API 的情况下ReAct 的性能优于传统的动作生成模型并且与链式推理CoT的性能相当。最佳结果是将 ReAct 和 CoT 相结合在推理过程中同时利用内部知识和外部信息。HotpotQA完全匹配6题发烧准确率3 发标准28.757.1仅理由CoT29.456.3仅限行动25.758.9反应27.460.9最佳 React CoT 方法35.164.6受监督的SoTA67.5使用约 14 万个样本89.5使用约 9 万个样本PaLM-540B 在 HotpotQA 和 Fever 上均有提示结果。在 ALFWorld 和 WebShop 上ReAct 结合单次提示和两次提示其性能优于使用约 105 个任务实例训练的模仿和强化学习方法与现有基线相比成功率分别绝对提高了 34% 和 10%。AlfWorld2 集网上商店一次性仅限行动4530.1反应7140模仿学习基线37使用约 10 万个样本29.1使用约 9 万个样本PaLM-540B 提示 AlfWorld 和 WebShop 上的任务成功率结果。使用 ReAct 和不同的基线方法在 HotPotQA 上测试提示和微调的扩展性结果。ReAct 始终能实现最佳的微调性能。图示为 ReAct上图和 CoT下图在 Fever 示例上的推理轨迹对比为节省篇幅省略了 ReAct 的观察结果。在本例中ReAct 给出了正确答案可以看出ReAct 的推理轨迹更基于事实和知识这与 CoT 的幻觉行为形成鲜明对比。我们还探索了人机交互允许人工检查员编辑 ReAct 的推理轨迹。我们证明只需将 ReAct 中出现的幻觉语句替换为检查员的提示ReAct 就能改变其行为以符合检查员的编辑并成功完成任务。使用 ReAct 解决任务变得显著容易因为它只需要手动编辑几个想法这为新型的人机协作提供了可能。这是一个使用 ReAct 在 AlfWorld 上进行人机交互行为纠正的示例。(a) 由于出现幻觉推理轨迹Act 17ReAct 轨迹失败。(b) 人工检查员编辑了两个推理轨迹Act 17 和 23之后 ReAct 生成了符合要求的推理轨迹和动作以完成任务。结论我们提出了 ReAct一种简单而有效的语言模型推理与行动协同方法。通过一系列侧重于多跳问答、事实核查和交互式决策任务的实验我们证明了 ReAct 能够带来更优异的性能并生成可解释的决策轨迹。ReAct 展示了在语言模型中联合建模思维、动作和环境反馈的可行性使其成为一个能够解决需要与环境交互的任务的多功能智能体。我们计划进一步拓展这一研究方向并利用语言模型的强大潜力通过大规模多任务训练以及将 ReAct 与同样强大的奖励模型相结合等方法来应对更广泛的具身​​任务。致谢我们衷心感谢 Jeffrey Zhao、Dian Yu、Nan Du、Izhak Shafran 和 Karthik Narasimhan 对这项工作的卓越贡献。我们还要感谢 Google Brain 团队和普林斯顿大学自然语言处理小组的共同支持和反馈包括项目范围界定、建议和富有洞见的讨论。原文链接The Second Half – Shunyu Yao – 姚顺雨。本文由AI翻译并人工校对仅供学习交流非商业用途可能存在误差请以原文为准。译文不代表本人观点。如涉侵权请联系删除。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询