Skip to main content
QUICK REVIEW

[论文解读] Learning to Manipulate Object Collections Using Grounded State Representations

Matthew Wilson, Tucker Hermans|arXiv (Cornell University)|Sep 17, 2019
Advanced Neural Network Applications被引用 7
一句话总结

本文提出了一种用于操纵可变尺寸物体集合的端到端强化学习方法,采用具身状态表征实现从仿真到现实的迁移。该方法训练一个卷积神经网络(CNN)用于基于图像的策略推理,并在原始物体位姿上使用图神经网络(GNN)进行奖励与价值估计,实现仿真环境与真实世界部署中的高成功率,且无需微调,对未见过的物体数量和类型具有强泛化能力。

ABSTRACT

We propose a method for sim-to-real robot learning which exploits simulator state information in a way that scales to many objects. We first train a pair of encoder networks to capture multi-object state information in a latent space. One of these encoders is a CNN, which enables our system to operate on RGB images in the real world; the other is a graph neural network (GNN) state encoder, which directly consumes a set of raw object poses and enables more accurate reward calculation and value estimation. Once trained, we use these encoders in a reinforcement learning algorithm to train image-based policies that can manipulate many objects. We evaluate our method on the task of pushing a collection of objects to desired tabletop regions. Compared to methods which rely only on images or use fixed-length state encodings, our method achieves higher success rates, performs well in the real world without fine tuning, and generalizes to different numbers and types of objects not seen during training.

研究动机与目标

  • 为机器人领域实现对可变尺寸物体集合的鲁棒、可泛化操控,该任务对现有仿真到现实方法构成挑战。
  • 解决多物体操控中仅使用图像表征和固定长度状态编码的局限性。
  • 通过将潜在表征与仿真器状态信息具身化,提升策略训练的稳定性和成功率。
  • 实现在仿真中训练的策略在真实世界中部署而无需微调。
  • 在训练期间未出现的物体数量和类型上实现泛化。

提出的方法

  • 在RGB图像与物体位姿目标配对的数据上训练CNN编码器,以学习基于图像的状态表征。
  • 在原始物体位姿上训练GNN编码器,以学习具身的、自编码的状态表征。
  • 在非对称演员-critic框架中使用GNN学习到的状态嵌入进行奖励计算与价值估计。
  • 在强化学习算法中联合使用两种编码器,训练能够将物体集合整体作为整体进行推理的基于图像的策略。
  • 在训练过程中应用领域随机化以提升仿真到现实的迁移性能,同时利用GNN嵌入稳定学习信号。
  • 以包含1至20个物体的多物体推动物体任务作为基准,于仿真环境中训练并在真实世界中部署。

实验结果

研究问题

  • RQ1来自仿真器状态的具身状态表征是否能提升多物体操控的策略学习?
  • RQ2结合基于CNN的图像编码与基于GNN的位姿编码,是否能增强仿真到现实的迁移性能与泛化能力?
  • RQ3该方法在训练期间未见过的物体数量和类型下表现如何?
  • RQ4该策略是否能在真实世界中实现高成功率而无需微调?
  • RQ5与基于自编码器或固定长度状态的方法相比,使用具身的GNN表征有何优势?

主要发现

  • 完整方法在仿真中取得了最高的成功率,优于自编码器和固定状态基线方法,尤其在具有挑战性的均匀初始物体分布下表现更优。
  • 在真实世界评估中,完整方法在所有测试配置中(包括10个立方体、20个立方体、银器和皱纸球)显著优于自编码器基线。
  • 该方法对未见过的物体类型和数量泛化良好,在10个立方体、20个立方体和银器任务中均实现了高成功率,且无需重新训练。
  • 在应用领域随机化时,将GNN学习到的状态嵌入用于非对称演员-critic框架中,显著稳定了训练过程,是成功的关键因素。
  • 使用完整损失函数($\mathcal{L}_{\text{FULL}}$)训练的模型在性能上略优于消融实验,尤其在真实世界泛化任务中表现更优。
  • 在真实世界试验中,策略成功执行了复杂的推动物体序列,如附带视频所示,展示了其鲁棒性与适应性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。