Science Robotics:机器人会空翻并不稀奇,伯克利、斯坦福团队搞定了“什么时候该空翻”

发布时间:2026/9/2 16:30:26
Science Robotics:机器人会空翻并不稀奇,伯克利、斯坦福团队搞定了“什么时候该空翻” 不只会学习更懂技能组合。人形机器人要真正进入为人类设计的环境行走只是起点。它们还需要完成奔跑、跳跃、翻滚、转身、躲避障碍等高动态动作并在任务变化时自然切换技能。更难的是这些动作既要稳定又要有类似人类的协调性与节奏感。传统方法通常依赖简化动力学模型、分层规划器或针对单一任务设计的奖励函数容易产生“持续迈步”“膝盖长期弯曲”“身体冲击较重”等不自然动作强化学习RL虽然已经让人形机器人掌握了平地行走、爬楼梯、奔跑和复杂地形穿越但每增加一种行为往往都需要新的奖励设计、参数调节甚至从头训练。而且这些方法通常局限于特定动作或特定目标缺乏组合多样化技能的通用性尤其是在处理未见过的任务时。如今加州大学伯克利分校、斯坦福大学团队实现了新的突破他们提出的基于强化学习的运动跟踪框架BeyondMimic能够让人形机器人先从人类动作学习再通过引导式扩散模型进行技能组合与任务适配。基于这一框架人形机器人可以在统一的训练设置下学习数百种动作包括空中侧手翻、旋踢、翻踢、冲刺和舞蹈并将这些技能迁移到真实硬件上。而且一旦部署后机器人还能处理训练阶段没有见过的路径导航、摇杆遥操作、障碍物躲避和动作插入任务。研究团队表示这项工作实现了从人类动作中可扩展地获取类人运动技能以及能够超越训练设置进行泛化与适应的运动合成BeyondMimic 的未来迭代版本有望发展出能够直接从人类示范中学习的模型并使机器人在不同环境中实现多样化动作。相关研究论文也于近日发表在权威科学期刊 Science Robotics 上。论文链接https://www.science.org/doi/10.1126/scirobotics.adx8924不只会学习更懂技能组合BeyondMimic 的目标是让人形机器人在训练阶段未见过的下游任务中合成多样化动作同时保持持续的敏捷性和类人的自然感。如下图BeyondMimic 框架包括以下两个阶段第一阶段使用可扩展的强化学习运动跟踪从多样化的人类动作中训练出一组具备高动态能力的运动技能第二阶段使用统一的潜在状态-动作扩散模型将这些技能整合到同一个运动分布中并通过分类器引导classifier guidance在推理阶段根据新目标生成和组合动作。图BeyondMimic 概述。A.通过运动跟踪从人类动作中实现可扩展、鲁棒的学习获得敏捷的类人行为能力B.借助引导扩散利用已学习到的多样化运动技能对未见过的下游任务实现多功能控制。第一阶段用统一配方学习人类动作第一阶段的任务是从人类示范中学习一组可迁移的运动技能。研究团队没有为每种动作设计独立的奖励和训练流程而是让不同参考动作共享同一套运动跟踪公式、奖励设计、观察空间、动作空间和超参数。以往方法通常面临两种选择。训练单个多技能策略具有较好的可扩展性但强化学习探索不足时容易产生不自然的动作。针对每种动作分别训练专门策略则可以提高自然度却需要针对动作逐一调参难以扩展到大规模技能库。BeyondMimic采用统一的运动跟踪流程和共享超参数在可扩展性与动作自然度之间取得平衡能够学习不同类型的人类动作同时保留人类水平的敏捷性。这一阶段还结合了精确的执行器建模、较少的域随机化、连续的方向表示、无历史观测和低延迟部署。研究团队认为仿真到现实的迁移能力并不依赖某个单独组件而是来自这些设计的整体配合。训练数据包含约 2.5 小时的人类动作。机器人在高保真仿真中验证了全部动作并将 21 个代表性动作片段部署到真实机器人上总时长约 15 分钟。这些动作涵盖了单腿站立、从不同姿势起身等平衡行为也包括单腿跳、转身踢、带 180° 或 360° 旋转的前跳、空中侧手翻等高动态动作。除此之外系统还学习了老年人风格行走、舞蹈、网球、羽毛球、地面爬行和从地面起身等具有不同风格和接触模式的技能。部分参考动作超过 3 分钟并且与多种其他技能共同训练。即便如此策略仍然保留了动作的敏捷性和风格细节。第二阶段用潜在扩散模型组合技能在这一阶段中研究团队训练了一个统一的潜在状态-动作扩散模型将第一阶段得到的多种运动技能整合起来。与只生成动作的扩散策略不同潜在状态-动作扩散模型不仅预测动作还隐式捕捉动作对未来状态的影响。这使模型能够在推理过程中对未来轨迹进行预判为任务适配和技能切换提供基础。模型的关键能力来自 classifier guidance。它是一种基于梯度的引导过程可以在生成过程中使用任务相关的成本信号将无条件动作生成引导为面向特定目标的条件生成。在预测控制过程中模型首先预测未来一段时间的状态和动作再通过多轮去噪逐步修正预测结果使轨迹朝指定目标收敛。目标可以是期望速度、路径点、关键姿态或障碍物距离。这使规划和控制不再完全分离。传统解耦式方案通常由运动学扩散规划器离线生成参考轨迹再交给独立的物理跟踪器执行。这样的流程容易重新引入规划器与跟踪器之间的不匹配而且动作质量受到跟踪器能力的限制。BeyondMimic将规划与控制放进同一个潜在状态-动作模型中允许 classifier guidance 直接在真实硬件上进行测试时调整。模型已经学习到一组可行的人类运动技能因此新任务只需要提供相对简单的目标成本就可以触发适合的动作组合。在这一机制下机器人能够根据速度指令在行走和奔跑之间切换也可以从摇杆控制的行走状态平滑进入翻滚、旋踢或翻踢再回到原来的运动模式。通过输入稀疏的未来关键帧系统还能补全关键帧之间的中间动作实现动作补全motion inpainting。两个阶段的部署都依赖实时 C 框架即使只使用 CPU 和性能适中的移动 GPU系统仍然实现了较强的仿真到现实迁移。敏捷性、自然感全都要研究团队从三个层面评估了 BeyondMimic一是机器人能否在真实环境中还原多样、高动态的人类动作二是通过用户研究看看走路和跑步的姿态是否够自然三是测试统一控制器能否依据速度、路径点、关键帧、障碍物这些目标在推理阶段灵活切换动作、组合任务。结果表明BeyondMimic 不仅能把多种运动技能稳定地搬到真实硬件上面对没见过的任务时动作依然连贯流畅也保留了明显的类人特征。1.多样动作与人类水平的敏捷性研究团队在室外软土、落叶和不平整地面上测试了机器人。这些接触条件没有出现在训练数据中但机器人仍然完成了空中侧手翻、连续侧手翻、地面爬行、从地面跳起以及受武术启发的动作。在空中侧手翻过程中机器人峰值加速度达到 31 m/s²骨盆角速度最高达到 15.7 rad/s平均角速度为 7.01 rad/s。研究团队指出熟练人类空中动作曾报告过约 7.75 rad/s 的平均角速度。机器人落地时保持了较好的姿态控制几乎不需要额外恢复动作。在连续动作方面机器人能够连续完成五次 C 罗庆祝式跳转并且没有明显失去稳定性或动作风格。这些结果表明第一阶段学习到的运动技能不仅能够迁移到真实硬件也能够在复杂、接触丰富的室外环境中保持较高的动态表现。2.行走与奔跑的自然程度为评估动作的自然程度研究团队组织了 77 名参与者进行用户研究。参与者观看 BeyondMimic 与 Unitree 原生控制器的 20 组行走和奔跑片段并选择哪一组看起来更像人类、更自然。研究团队最终获得 1539 次有效选择。整体而言BeyondMimic 获得了70.8% 的偏好。分步态来看行走动作中 BeyondMimic 的偏好率为 57.0%奔跑动作中BeyondMimic 的偏好率达到 84.7%。机器人在行走过程中受到人为轻微扶持时会保持一定柔顺性暂停并稳定在原地外力释放后再平滑恢复行走。这种响应避免了僵硬或夸张的反应也体现了控制器在自然运动之外对外部干扰的适应能力。3.未见任务中的运动切换与技能组合这项工作还关注 BeyondMimic 能否在推理阶段根据不同目标组织已经学到的技能。研究团队测试了速度命令、路径点导航、关键帧动作插入以及障碍物躲避等任务。在命令条件运动实验中系统接收线速度、偏航速度或路径点目标。面对不同初始位置机器人能够生成平滑轨迹到达目标点。通过摇杆输入时它可以跟踪全向速度指令并在受到踢击等较大外部扰动后继续朝目标移动。在更长距离的测试中机器人沿赛道连续奔跑超过 50 米。仿真评估显示行走和奔跑的平均速度跟踪误差分别为 12.14% 和 13.65%。在较低速度指令下策略可以生成稳定行走也可以生成轻快慢跑随着目标速度变化机器人能够从行走平滑过渡到奔跑而不需要手动切换策略。研究团队还使用 motion inpainting 测试动作插入能力。机器人原本处于摇杆控制的行走状态系统每隔 0.2 秒插入翻滚动作的目标关键帧。扩散策略随后生成连续轨迹使机器人从行走平滑进入空中侧手翻完成动作后又回到命令控制的行走状态。同样的方法还支持从行走过渡到躺下再起身站立以及从行走切换到旋踢和翻踢等高动态动作。在任务组合实验中研究团队将路径点跟踪成本与障碍物躲避成本结合实现了简单的场景感知导航。机器人面对正前方的障碍物时在扩散去噪过程中利用障碍物距离信息调整未来轨迹最终绕开障碍物并到达目标点。当路径点成本被替换为摇杆跟踪成本后避障机制仍然有效即使用户输入方向与安全路径并不完全一致机器人也能够在一定程度上降低碰撞风险。这些结果证明BeyondMimic 并非只能按照训练数据中的完整动作进行复现。通过推理阶段的 classifier guidance统一控制器可以在速度、路径点、关键帧和避障目标之间切换并将多个已学习技能组合成新的连续行为。不足与未来方向当然BeyondMimic 框架还有很多需要改进的地方。研究团队表示BeyondMimic 的扩散模型非常依赖底层状态估计系统的质量。如果本体感知出现误差错误信息会直接传播到生成轨迹中。潜在扩散模型对噪声具有一定鲁棒性但进一步结合传感器融合或学习式状态估计仍然是提升性能的重要方向。当前系统的预测时域足以支持反应式控制和局部避障但不足以完成需要提前判断远距离目标或障碍物的长程规划。历史信息有助于稳定未来预测但也可能让模型在引导过程中陷入重复动作模式。研究团队通过增大引导权重进行缓解但过大的权重可能在模式切换或高方差状态下使去噪过程不稳定。因此机器人在动作开始和结束阶段仍更容易出现绊倒。此外当前基于引导的优化更适合粗粒度目标对精细控制的效果相对有限且仍需要对引导权重进行轻量调节。研究团队认为未来可以探索监督微调和适配器式控制层从而支持更细粒度、可组合的轨迹控制减少人工调参需求。BeyondMimic 的价值不只在于让机器人完成某个翻滚或某段奔跑而在于把高质量动作学习、技能切换、任务规划和实时控制放进同一个框架。当新增的人类动作可以持续扩展技能库而新的任务只需提供目标成本、不必为每项任务重新训练时人形机器人就有可能从“按预设动作执行”走向“根据环境组织行为”。这也是 BeyondMimic 所指向的长期方向让机器人直接从人类示范中学习并在不同动作、环境和目标之间保持适应能力。原文链接Science Robotics机器人会空翻并不稀奇伯克利、斯坦福团队搞定了“什么时候该空翻”-36氪