☰
3.5万次真机实测:北京人形提出RoboAug,让机器人数据“少采也能泛化”(CoRL 2026)
2026/10/7 16:30:07 网站建设 项目流程

机器人想要适应开放世界,不一定要先收集覆盖所有场景的海量真机数据。

——RoboAug

目录

01 机器人数据增广,到底卡在哪?

02 一张标注图,怎么‘变’出几百个场景?

第一步:任务相关区域的一次性提取(一张参考图,完成跨轨迹匹配)

第二步:语义数据增广(生成完整背景,而不是在遮挡区域里“脑补”)

第三步:区域对比策略学习(不仅让模型看见目标,还要让它真正关注目标)

03 超过3万5千次的真机测试,效果到底如何?

三种干扰同时出现,RoboAug 仍保持领先

面对 170 种新背景,成功率达到 54%

区域对比学习,让注意力从背景回到操作对象

04 数据并非越多越好:增强比例存在“甜点区”

05 RoboAug 带来的启示

06 写在最后


机器人学东西,最贵的从来不是模型,而是数据。

换一块台面、换一种光照、旁边多一个无关物体,刚训好的策略就可能“手抖”——这是具身智能走向真实场景的一道现实难题。

过去主要有两条路:

  • 一是大规模数据采集 + 预训练,烧钱又耗时;
  • 二是语义数据增广,用生成模型换背景、加干扰物,但前提是上游目标检测足够准确——而现实中,视觉基础模型在机器人场景里经常“看走眼”,一个错误的边界就可能把动作带偏。

所以,真正做起来,远没有“换个背景图”这么简单。

近日,北京人形机器人创新中心等机构提出 RoboAug——一套区域对比数据增广框架。

只需一张图的边界框标注,就能自动生成不同背景、干扰物和光照的训练场景,并显著提升模型性能,并在三台真实机器人上完成了超过 3.5 万次测试。该工作已被CoRL 2026接收。

▲图 1|RoboAug 从受控训练场景出发,通过区域提取、语义增强与区域对比学习,提高策略在复杂背景、光照和杂物干扰下的泛化能力

01 机器人数据增广,到底卡在哪?

先回到问题本身。为什么机器人的泛化这么难?

真实世界里,机器人面对的干扰主要来自三个方面:复杂的背景、光照变化,以及与任务无关的干扰物。

这些因素叠加在一起,策略很容易“认死理”——训练台面上抓得好好的,换个花纹桌布就抓空。

传统的“弱增广”,比如随机裁剪、色彩抖动、轻微平移,本质上只是给图像加噪声,难以引入真实的语义变化,对跨环境泛化帮助有限。

进一步的做法是“语义增广”:用大模型替换背景、添加干扰物,同时保持机器人和目标物体不变。但它有一个隐藏前提——你得先准确知道哪块像素是机器人、哪块是目标物体。

研究团队专门测试了一下:在 33 个机器人操作任务、7576 条轨迹上,用 GroundingDINO 和 LMMDet 这两个当前最强的开放世界检测器去做实例分割,结果失败率很高——

边界缺失、区域幻觉、物体被背景纹理“吃掉”,一旦这些错误被传给生成模型,前景就会被污染,机器人学到的动作自然跟着跑偏。

问题就在这里:以前的生成式增广默认上游检测是完美的,但真实机器人数据根本做不到这一点。

因此,RoboAug 解决的并不是简单的“背景生成”,而是一个更基础的问题:

如何以极低标注成本,稳定地找到整套机器人数据中的任务相关区域。

02 一张标注图,怎么‘变’出几百个场景?

RoboAug 的思路可以拆成三步。核心一句话:只人工标一张图,剩下的全自动,覆盖整套轨迹。

▲图 2|RoboAug 的三阶段完整流程

第一步:任务相关区域的一次性提取(一张参考图,完成跨轨迹匹配)

对于每个任务,只需要在一张参考图像中框出任务相关对象。

RoboAug 先用 DINOv2 提取参考区域的视觉特征,再用 GroundingDINO 在其他轨迹的首帧生成候选框,通过特征相似度找到对应对象。

这里的关键是:让检测模型负责“找候选”,而不是直接做最终判断。

即使检测类别不够准确,也可以借助参考图像的视觉特征,筛掉无关区域、修正匹配结果,而且不需要额外训练检测器。

找到首帧对象后,再用 SAM 2 完成分割和跟踪,把结果传播到后续帧,最终得到连续的像素级掩码

人工标注的工作量,被压缩到了"一条轨迹标一次框"。

第二步:语义数据增广(生成完整背景,而不是在遮挡区域里“脑补”)

获得任务区域的精确掩码后,RoboAug 用大语言模型生成背景描述,再通过 Stable Diffusion 3 Medium 合成完整背景,并构建了 500 个模板,覆盖木材、石材、复合材料等常见桌面环境。

不同于直接在原图上修补背景,RoboAug 先生成完整、连贯的新场景,再将原图中的机械臂和任务对象叠加上去。这样既能避开机械臂遮挡带来的修补难题,也能尽量保持物体几何和动作标签不变。

换句话说,RoboAug 改变的是“机器人在哪里工作”,而不是“机器人正在操作什么”。

第三步:区域对比策略学习(不仅让模型看见目标,还要让它真正关注目标)

仅靠生成更多背景,并不能保证策略不走捷径——增广后的图像里,大部分仍是无关背景。为此,RoboAug 引入区域对比学习(Region-Contrastive Learning,RCL)。

训练时,根据掩码提取任务物体的区域特征:拉近同类物体在不同场景中的表示,推远不同类别的表示;同时利用空间注意力强化真正有信息的区域。

说白了,就是逼着模型“别看花里胡哨的,盯住该操作的目标”。

这套方法不需要改动策略本身,ACT、π0 都可以直接接入,是一套可叠加在现有训练流程上的通用增强方案。

03 超过3万5千次的真机测试,效果到底如何?

为了避免只在单一机械臂或少量场景中验证,RoboAug 在三台形态完全不同的机器人上做了验证:

单臂的 UR-5e、双臂的 AgileX,以及人形机器人 Tien Kung 2.0;

三类机器人共覆盖 15 项任务,从单臂抓取、放置和开抽屉,到双臂叠碗、扶正杯子、摆放餐具和加热面包。

每项任务采集 50 条真实专家轨迹,最终完成超35,000 次真实机器人测试。

▲图 3|RoboAug 在 UR-5e、AgileX 与天工 2.0 上覆盖单臂和双臂操作任务。

泛化测试的条件堆得很足:

  • 背景:170 种没见过的台面纹理,从规则几何图案到杂乱花纹;
  • 干扰物:工作区里摆 10 个无关物体;
  • 光照:20 种动态变化的灯光;
  • 三重因子组合:同时换背景 + 加干扰物 + 变光照。

▲图 4|从原始环境到背景、干扰物、光照变化,再到双因素和三因素组合测试。

三种干扰同时出现,RoboAug 仍保持领先

不使用数据增强时,UR-5e、AgileX 和天工 2.0 上的平均成功率分别只有 9%、16% 和 19%;引入 RoboAug 后,成功率分别提高到 47%、60% 和 67%。

与最强数据增强基线 GenAug 相比,RoboAug 在三类机器人上的相对提升分别达到 51.6%、76.4% 和 59.5%。

这说明它的收益并不局限于某一种机器人本体。

▲图 5|15 项任务在三因素变化下的完整结果。

面对 170 种新背景,成功率达到 54%

研究团队进一步在 UR-PutCornPot 任务上测试了 170 种训练期间从未出现的桌面纹理,包括规则几何图案、结构化设计和随机散布图案。

RoboAug 的平均成功率达到 54.0%,明显高于 GenAug 的 36.8%。随着背景图案变复杂,两种方法都会受到影响,但 RoboAug 的性能下降更缓,说明策略更少依赖背景纹理。

▲图 6|RoboAug 在 170 种未见桌面纹理上的泛化表现。

区域对比学习,让注意力从背景回到操作对象

Grad-CAM 可视化进一步展示了 RCL 的作用。

没有 RCL 时,策略的注意力容易散落在高频背景纹理或无关物体上;加入 RCL 后,即使同时改变背景、光照并加入干扰物,模型仍能将注意力集中在抓取点和任务对象附近。

▲图 7|加入 RCL 后,策略在复杂环境中仍能更准确地关注任务相关区域。

消融实验也给出了一致结论:

在三个代表性任务上,RoboAug 加入 RCL 后的平均成功率由 46% 提高到 56%;在天工 2.0 的称重苹果任务中,成功率从 68% 提高到 80%。

在 LIBERO-Plus 仿真基准上,RoboAug 对背景、干扰物和光照变化的平均成功率达到93.3%,高于 RoboEngine-G 的 86.8% 和无增强 ACT 的 79.8%。

04 数据并非越多越好:增强比例存在“甜点区”

文章还展示了一个容易被忽略的现象:合成数据并不是越多越好。

例如在 UR-StackBowl 任务中,增强比例从 1:0 提升到 1:3、1:5 和 1:8 时,未见背景上的表现持续提升;但超过 1:15 后,成功率反而明显下降。

▲图 8|增强比例呈倒 U 形趋势,约 1:5 的原始数据与增强数据比例取得较好平衡

适量的合成数据可以帮助模型摆脱对训练背景的依赖;但比例过高,也可能放大合成分布与真实世界之间的偏差。

因此,RoboAug 给出的经验不是“尽可能多地生成”,而是以真实轨迹为锚点,有控制地扩展视觉分布。论文中统一采用 5 倍扩展,即 50 条真实轨迹搭配 250 条生成轨迹。

05 RoboAug 带来的启示

回头看 RoboAug,它真正的贡献不在于“又造了一个生成模型”,而在于拆掉了机器人数据增广中的四个默认假设:

第一,不依赖大规模预训练数据。不需要先在海量真实场景里跑几百万条轨迹,一套框架内就能解决。

第二,不依赖完美的上游视觉识别。不再赌"VFM 能把所有物体都框对",而是用"人工标一帧 + 时序传播"把标注误差控制住。

第三,它把掩码从图像合成工具变成了训练监督。过去,语义掩码往往在生成新图片后就完成使命;RoboAug 则继续用它构造区域对比目标,直接约束视觉表征,让策略学习什么应该保持不变。

第四,它证明了数据层方法也可以跨机器人、跨策略发挥作用。相比继续扩大预训练规模,这条路线尤其适合真实数据有限、部署环境变化又很大的机器人任务。

当然,它也有边界:每个新任务仍需标注一张参考图;当前增广主要覆盖视觉环境,无法直接扩展物体动力学和动作分布;合成数据过多也可能带来性能下降。

因此,如何自动选择高价值的增强场景,并进一步扩展到物理交互变化,仍值得探索。

06 写在最后

RoboAug 已经给出了较为清晰答案:机器人想要适应开放世界,不一定要先收集覆盖所有场景的海量真机数据。找准任务相关区域、生成足够多样但标签可靠的视觉环境,再让策略学会忽略无关变化,一张标注也可以成为数百种场景的起点。

让机器人少在数据里"泡",多在场景里"见"——用一张标注换几百个场景,这件事的经济账,在真实机器人开发里是算得过来的。

Ref

论文题目:RoboAug: One Annotation to Hundreds of Scenes via Region-Contrastive Data Augmentation for Robotic Manipulation

论文链接:https://arxiv.org/abs/2602.14032

项目主页:https://x-roboaug.github.io/

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询