
26年9月来自伯克利分校、圣何塞州立大学、Meta公司和Apple公司等的论文“Do World Models Make Better Robots?”。这篇论文最有价值的观点是:世界模型的评估应当落实到“预测未来能否帮助机器人更好地行动”,并测出这种帮助发生在哪些任务、哪些能力上。 但论文的若干关键分类存在明显问题,因此,它提出的研究方向值得重视,“11/160”等统计结论则需要谨慎引用。论文首先提出了一个明确的问题:预测能力与行动能力之间,缺少什么证据?如图 1 所示预测还是行动?这是该综述基于实际基准提出的核心问题。闭环(左侧):策略类和具身智能类基准通过在环境中运行策略来评估任务成功率。开环(右侧):世界模型和视频生成类基准在不涉及实际行动的情况下,评估预测或生成的质量。处于中间轴位置的问题是上述两端均未直接回答的:预测是否能带来闭环优势?而在160个基准中,仅有11个明确构建了这种优势(见表10)。作者观察到,机器人研究中有两套相对分离的评测方式:直接策略,包括视觉—语言—动作模型(VLA):根据观察和指令产生动作,通常通过机器人在环境中的任务成功率来评价。预测式世界模型:预测未来状态、图像或视频,很多评测关注预测是否准确、画面是否逼真、运动是否符合物理规律。两套评测分别回答了“任务完成得怎样”和“未来预测得怎样”,却不一定回答:加入世界模型以后,相比条件匹配的直接策略,机器人究竟提高了多少?例如,一个模型能生成“机械臂成功拿起杯子”的逼真视频,并不能保证视频对应的抓取位置、接触过程和运动轨迹可以执行。反过来,一个机器人任务成功率很高,也不能单凭这一结果认定收益来自世界模型。作者希望建立的证据链是:世界模型提供预测 → 预测影响决策 → 动作在环境中执行 → 获得反馈 → 与直接策略比较实际收益。这里的“执行”可以发生在仿真环境中,并不意味着一定经过真实机器人验证。论文的调查对象是评测基准,范围相当广。(第 2 节,第 4—7 页)作者汇集了 2017—2026 年的 160 个基准,并选出 86 个作为核心分类中的代表,涉及 12 个能力领域,同时与 8 篇相关综述或立场论文比较。如图 2 所示按时间顺序排列的最相关基准测试/评估综述如下。其中两项发表于近期热潮之前:一篇是关于具身智能(Embodied AI)仿真器与任务的 IEEE TETCI 综述 [42],另一篇是关于真实机器人强化学习(RL)可复现性的 CoRL 综述 [95](琥珀色标记表示经同行评审的会议/期刊);其余均为 2026 年发布的预印本,涵盖具身评估、VLA 数据及世界模型等领域。