[论文解读] Multi-Task Domain Adaptation for Deep Learning of Instance Grasping from Simulation
该论文提出了一种多任务域自适应框架,通过使用带标注数据的仿真环境训练深度神经网络进行实例抓取,然后仅利用两个领域中的无差别抓取数据,将模型迁移到真实机器人上。通过在实例抓取和无差别抓取任务之间共享网络架构,并应用域对抗损失,该方法在无需真实世界标注数据的情况下,实现了64.8%的真实世界实例抓取成功率,优于基线方法以及双塔域自适应方法。
Learning-based approaches to robotic manipulation are limited by the scalability of data collection and accessibility of labels. In this paper, we present a multi-task domain adaptation framework for instance grasping in cluttered scenes by utilizing simulated robot experiments. Our neural network takes monocular RGB images and the instance segmentation mask of a specified target object as inputs, and predicts the probability of successfully grasping the specified object for each candidate motor command. The proposed transfer learning framework trains a model for instance grasping in simulation and uses a domain-adversarial loss to transfer the trained model to real robots using indiscriminate grasping data, which is available both in simulation and the real world. We evaluate our model in real-world robot experiments, comparing it with alternative model architectures as well as an indiscriminate grasping baseline.
研究动机与目标
- 为解决实例抓取中仿真到真实世界的迁移挑战,其中收集真实世界标注数据成本高昂且耗时。
- 实现仅基于仿真数据中带有成功奖励标注的实例抓取策略,在无需真实世界标注的情况下实现零样本真实世界部署。
- 通过在任务间共享特征的域对抗自适应方法,缓解仿真与真实世界之间的域偏移。
- 仅使用单目RGB图像和单个初始实例分割掩码,避免逐帧分割,证明其在有效迁移中的可行性。
- 在无需额外真实世界微调的情况下,展示对真实世界未见过物体的泛化能力。
提出的方法
- 采用多任务学习框架,联合训练实例抓取和无差别抓取任务,共享卷积特征并使用任务特定头。
- 模型以单目RGB图像和单个实例分割掩码作为输入,预测候选运动指令的成功概率。
- 在共享特征表示上应用域对抗损失,以最小化仿真与真实世界数据之间的域偏移。
- 利用来自仿真和真实世界中的无差别抓取数据训练域判别器,实现特征级别的对齐。
- 网络采用三塔架构:共享RGB流、每类抓取任务对应的特定头,以及用于对抗自适应的域判别器。
- 仅在每个任务开始时使用一次Mask R-CNN生成目标物体掩码,避免实时推理开销。
实验结果
研究问题
- RQ1仅在仿真实例抓取数据上训练的模型,能否在不使用任何真实世界标注数据的情况下泛化到真实世界部署?
- RQ2多任务域自适应在减少仿真与真实世界机器人抓取之间域偏移方面的有效性如何?
- RQ3在实例抓取与无差别抓取任务之间共享网络架构,是否相比独立架构能提升迁移性能?
- RQ4单个初始分割掩码是否足以在真实世界场景中实现有效的实例抓取?
- RQ5与仅使用无差别抓取策略或双塔域自适应的基线方法相比,所提方法表现如何?
主要发现
- 所提方法在真实世界实例抓取中实现了64.8%的成功率,显著优于无差别抓取基线(在目标物体上成功率为13.6%)。
- 三塔多任务域自适应框架实现了64.8%的成功率,优于双塔基线(34.8%),证明了弥合任务与域差距的重要性。
- 使用恒定掩码而非为实例抓取单独设置网络头,性能从58.4%提升至64.8%,表明架构一致性可增强迁移能力。
- 该模型在真实世界测试中成功泛化到未见过的家用器皿类物体,表明对分布偏移具有鲁棒性。
- 该方法成功将仅在仿真环境中训练的策略迁移到真实机器人上,仅使用真实世界的无差别抓取数据进行域自适应。
- 域对抗损失有效减少了域偏移,使得在无真实世界实例抓取标注数据的情况下,仍能实现高性能的真实世界表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。