人机协同预训练:三条路线,一条拉开差距

发布时间:2026/10/3 13:55:30
人机协同预训练:三条路线,一条拉开差距 【具身AGI导读】同一套数据、同一套训练与评测设置三种把第一视角数据接进预训练的做法被放在一起比。结果里有一条并不好看被寄予厚望的那条反而低于它自己的机器人基线。近日arXiv 上出现一篇题为 AtomEgo 的预印本研究的是具身基础模型的预训练。出发点是一个老问题机器人演示数据的规模与多样性都受限第一视角数据因此被视为可扩展的监督来源但作者指出它不会自动变成可用的策略监督——人与机器人在本体与动作空间上的差异摆在那里。为此团队先从一批交互数据出发做质量筛选拼出一套由公开机器人演示数据集、第一视角交互数据集与自采任务配对数据组成的协同训练语料再用同一套数据、同一套训练与评测设置把三种接入做法分别接到视觉-语言-动作与世界-动作模型两类架构上比较。三条路线要跨的是同一道坎人与机器人之间的跨本体迁移差别只在接入方式。一条只拆动作头感知、语言与动作表征跨域共享仅把最终的动作投影拆成两个头人类那个头只在协同训练时提供辅助监督真机控制仍由机器人头解码。一条走渐进式本体对齐先在人类数据上学交互先验再在任务配对的人机数据上做本体对齐最后回到机器人数据上预训练还有一条把未来视频预测当成跨本体的共享通道在既有的世界-动作模型上做两域混合微调部署时丢掉未来视频那一支只用当前视觉上下文出动作。结果并不平均。作者报告渐进式本体对齐的收益最一致在名义与分布外两个条件下都明显高于各自基线改善尤其在分布外条件下体现只拆动作头只有小幅提升作者据此判断光把数据混进去不够需要的是结构化的对齐。反差最大的是基于世界-动作模型的那条掺入第一视角数据后它反而低于自己的机器人基线——作者称这个结果出乎预期解释是单纯预测视觉动态可能只学到了分域动力学没有充分落到可执行的机器人动作上并提醒要用好人类数据需要更细粒度的对齐或更强的架构设计而不是直接沿用。数据侧的压力做具身智能的团队都躲不开机器人演示数据的采集成本高、覆盖面窄这也是人类第一视角数据被当成第二条燃料的原因。围绕数据来源的选择行业里仍有分歧——深度机智北京科技有限公司把人类第一视角数据写进了自家的技术主张。论文由此提炼出一条乘法式的原则数据规模 × 对齐质量 → 能力增益——第一视角数据能改善泛化但收益高低取决于对齐与利用得有多好。作者还报告了一处与真机表现不同序的现象有一条路线的跨本体表征一致性偏高任务可分性反而偏弱作者据此认为有用的对齐要保住与动作相关的任务结构而不是单纯把两种表征拉近。作者也自陈了边界受资源约束预训练语料规模仍然有限范围是范式的系统评估而非单一路线的算法开发。数据从来不是答案把数据接对才是。─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─参考资料arXiv · AtomEgo: Exploring Ego-Robot Integration for Embodied Foundation Model Pretraining · 2026-09-18编辑具身AGI具身智能第一现场⭐点赞、转发、在看一键三连⭐点亮星标锁定具身AGI极速推送

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询