Skip to main content
QUICK REVIEW

[论文解读] RetinaGAN: An Object-aware Approach to Sim-to-Real Transfer

Daniel E. Ho, Kanishka Rao|arXiv (Cornell University)|Nov 6, 2020
Robot Manipulation and Learning参考文献 35被引用 7
一句话总结

RetinaGAN 是一种基于 GAN 的模拟到现实的迁移方法,能够在保留目标检测一致性的同时,将模拟图像适配为真实世界视觉效果,从而在机器人领域实现有效的策略迁移。与先前方法相比,其抓取成功率提高了 12%,即使仅使用 5%–10% 的真实数据,也能保持强劲性能,展示了在推动物体和开门等任务中的强大泛化能力。

ABSTRACT

The success of deep reinforcement learning (RL) and imitation learning (IL) in vision-based robotic manipulation typically hinges on the expense of large scale data collection. With simulation, data to train a policy can be collected efficiently at scale, but the visual gap between sim and real makes deployment in the real world difficult. We introduce RetinaGAN, a generative adversarial network (GAN) approach to adapt simulated images to realistic ones with object-detection consistency. RetinaGAN is trained in an unsupervised manner without task loss dependencies, and preserves general object structure and texture in adapted images. We evaluate our method on three real world tasks: grasping, pushing, and door opening. RetinaGAN improves upon the performance of prior sim-to-real methods for RL-based object instance grasping and continues to be effective even in the limited data regime. When applied to a pushing task in a similar visual domain, RetinaGAN demonstrates transfer with no additional real data requirements. We also show our method bridges the visual gap for a novel door opening task using imitation learning in a new visual domain. Visit the project website at https://retinagan.github.io/

研究动机与目标

  • 通过在图像域适应过程中保留任务关键的目标语义,解决模拟到现实强化学习与模仿学习中的视觉现实差距。
  • 克服标准 GAN 可能扭曲或移除机器人操作所需关键视觉特征的局限性。
  • 在无需大量真实世界数据采集的情况下,实现从仿真环境到真实世界环境的有效策略迁移。
  • 通过检测一致性损失,确保适配过程保留目标级别的结构与纹理,从而在多种视觉域之间具备鲁棒性。
  • 展示单个 RetinaGAN 模型在少量微调或真实数据的情况下,跨多种任务和视觉域的可迁移性。

提出的方法

  • 训练一个 CycleGAN,将模拟图像转换为真实图像,同时保持目标检测的一致性。
  • 引入感知一致性损失($\mathcal{L}_{\text{prcp}}$),强制原始模拟图像与其 GAN 转换后的对应图像之间保持不变的目标检测预测结果。
  • 在真实和模拟数据上均使用预训练的目标检测器(EfficientDet)生成检测输出,以提供监督信号。
  • 使用仅未配对的真实与模拟图像,在无任务特定损失依赖的情况下,以无监督方式训练 GAN。
  • 采用谱归一化和 Adam 优化以稳定 GAN 训练,超参数仅在极窄范围内进行调优。
  • 在所有任务和领域中复用相同的预训练检测器,确保一致的语义监督,无需重新训练。

实验结果

研究问题

  • RQ1基于目标感知的域适应是否能提升视觉引导机器人操作任务中的模拟到现实迁移性能?
  • RQ2与标准 GAN 相比,RetinaGAN 在图像转换过程中对目标级别结构与纹理的保留程度如何?
  • RQ3当仅提供 5%–10% 真实数据时,RetinaGAN 在低数据场景下的有效性如何?
  • RQ4在仅使用抓取任务数据训练的 RetinaGAN 模型,是否可成功复用于其他任务(如推动物体)而无需额外真实数据?
  • RQ5RetinaGAN 是否能泛化到新视觉域(如真实会议室内开门任务)且仅需极少数据?

主要发现

  • 当使用完整真实数据时,RetinaGAN 相较于先前的模拟到现实方法,使真实世界抓取成功率提高了 12%。
  • 仅使用 5%–10% 真实数据时,RetinaGAN 的性能仅下降 14%,展示了其在低数据场景下的强大泛化能力。
  • 在未进行任何额外真实数据收集或微调的情况下,基于抓取数据训练的 RetinaGAN 模型在 3D 物体推动物体任务中实现了 90% 的成功率。
  • 对于不同视觉域中的新型开门任务,使用模仿学习的 Ensemble-RetinaGAN 变体实现了 97% 的成功率。
  • 该方法在图像翻译过程中保持了稳定的对象检测预测结果,证实了语义结构与纹理的保留。
  • 相同的预训练目标检测器在所有任务和领域中均表现有效,验证了该方法的泛化能力与可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。