HuRo:将人类视频转化为机器人数据,实现可扩展的 VLA 预训练

发布时间:2026/9/25 20:11:25
HuRo:将人类视频转化为机器人数据,实现可扩展的 VLA 预训练 26年8月来自韩国rlwrld.ai公司和延世大学的论文“HuRo: Robotizing Human Videos for Scalable VLA Pretraining”。本文研究如何将人类操作视频转换成机器人训练数据。它的重要贡献是建立并验证了一条大规模数据生产路线;实验支持其预训练价值,但尚不能说明生成的数据具有可靠的物理可执行性。一、论文概述机器人训练面临一个现实问题:真实机器人示范昂贵,人类操作视频却很丰富。但人类与机器人在外观、身体结构、关节和动作空间上存在差异,不能直接把人类视频当作机器人示范。HuRo 的做法是对视频进行“机器人化”:画面转换:擦除人的手臂,再叠加渲染的机器人。动作转换:恢复人手的三维运动,映射为机器人的手腕与手指运动。语言标注:生成描述操作内容的指令。最终得到“图像—语言—机器人状态—动作”配对数据,用于视觉—语言—动作模型(VLA)预训练,再用少量真实机器人示范微调。作者整合五个人类视频数据源,构建了约 63 万条片段、1.422 亿帧、1,317 小时的数据集。如图 1 所示面向现实世界操作任务的 HuRo 预训练概览。利用“视觉机器人叠加”(visual robot overlay)和“动作重定向”(motion retargeting)技术,将海量人类活动视频转化为机器人操作片段。由此生成的片段包含语言指令、机器人状态及动作数据,可用于 VLA 策略的预训练。在经过下游微调后,基于更大规模 HuRo 子集预训练的策略在现实世界操作任务中展现出了更优的性能。二、主要想法:同时对齐“看到的身体”和“要执行的动作”论文认为,仅从人类视频中学习视觉知识,或者只提取动作而保留人类画面,都没有充分解决人机差异。其方法可以概括为:人类视频 → 恢

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询