Skip to main content
QUICK REVIEW

[论文解读] Scaling Robot Learning with Semantically Imagined Experience

Tianhe Yu, Ted Xiao|arXiv (Cornell University)|Feb 22, 2023
Topic Modeling被引用 4
一句话总结

该论文提出ROSIE方法,利用文本到图像的扩散模型生成语义有意义、逼真的数据增强,用于机器人学习,且无需收集真实世界数据。通过自然语言提示对物体、背景和干扰物进行修复,ROSIE使策略能够泛化到未见过的任务,并在新颖的杂乱环境中表现出更强的鲁棒性,显著将分布外场景下的成功检测F1分数从0.19提升至0.57。

ABSTRACT

Recent advances in robot learning have shown promise in enabling robots to perform a variety of manipulation tasks and generalize to novel scenarios. One of the key contributing factors to this progress is the scale of robot data used to train the models. To obtain large-scale datasets, prior approaches have relied on either demonstrations requiring high human involvement or engineering-heavy autonomous data collection schemes, both of which are challenging to scale. To mitigate this issue, we propose an alternative route and leverage text-to-image foundation models widely used in computer vision and natural language processing to obtain meaningful data for robot learning without requiring additional robot data. We term our method Robot Learning with Semantically Imagened Experience (ROSIE). Specifically, we make use of the state of the art text-to-image diffusion models and perform aggressive data augmentation on top of our existing robotic manipulation datasets via inpainting various unseen objects for manipulation, backgrounds, and distractors with text guidance. Through extensive real-world experiments, we show that manipulation policies trained on data augmented this way are able to solve completely unseen tasks with new objects and can behave more robustly w.r.t. novel distractors. In addition, we find that we can improve the robustness and generalization of high-level robot learning tasks such as success detection through training with the diffusion-based data augmentation. The project's website and videos can be found at diffusion-rosie.github.io

研究动机与目标

  • 为解决依赖人工演示或工程化自主系统而导致的真实世界机器人数据收集成本高、耗时长的问题。
  • 探究现成的文本到图像扩散模型是否能够生成多样、真实且语义有意义的机器人学习训练数据。
  • 提升机器人策略和成功检测器在分布外(OOD)环境中面对新物体和杂乱场景时的鲁棒性和泛化能力。
  • 开发一种通用的数据增强框架,在保持语义和空间一致性的同时,实现对新任务的零样本适应。

提出的方法

  • 利用最先进的文本到图像扩散模型(如DALL-E 2、Stable Diffusion)对现有的机器人示范图像执行语义修复。
  • 通过提示工程解析自然语言指令,识别需修改的区域,如目标物体、干扰物或背景。
  • 应用带有文本引导的修复方法,替换特定图像区域,同时保持场景其余部分(包括机器人姿态和物体抓取)不变。
  • 通过提示的系统性变化(如物体身份、颜色和场景上下文),生成多样且逼真的训练数据。
  • 在增强的数据集上训练下游模型(如策略、成功检测器),结合真实数据与语义一致的合成数据。
  • 使用CLIP-based成功检测器评估在包含未见干扰物和新物体的分布外测试集上的泛化性能。

实验结果

研究问题

  • RQ1文本引导的图像生成模型能否生成逼真且语义有意义的数据增强,从而提升机器人学习中的零样本泛化能力?
  • RQ2ROSIE在无需额外真实世界数据收集的情况下,能在多大程度上提升策略对新物体和未见环境的泛化能力?
  • RQ3ROSIE是否能提升高阶任务(如在包含新干扰物的分布外场景中)的成功检测鲁棒性?
  • RQ4使用扩散模型进行数据增强的规模如何影响在分布内和分布外基准上的下游性能?

主要发现

  • ROSIE显著提升了在分布外测试集上成功检测的F1分数——从无增强时的0.19提升至完整ROSIE增强后的0.57,表明对新干扰物具有极强的鲁棒性。
  • 在分布内任务上的性能保持稳定(F1 ≈ 0.66),表明ROSIE不会损害对已见分布的性能。
  • 在ROSIE增强数据上训练的策略能够成功泛化到完全未见过的任务,例如将黄色薯片袋移动到桃子附近,即使这些物体未出现在原始训练数据中。
  • 该方法实现了有效的数据增强,同时保持了空间和语义一致性,使模型能够在视觉变化下仍学习到任务相关特征。
  • ROSIE在不依赖仿真或运动数据的情况下实现了性能提升,仅依赖图像级别的语义增强。
  • 尽管采用逐帧增强,策略学习中仍保持了时间一致性,如Robotics Transformer架构的性能表现稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。