Skip to main content
QUICK REVIEW

[论文解读] Learning Dense Rewards for Contact-Rich Manipulation Tasks

Zheng Wu, Wenzhao Lian|arXiv (Cornell University)|Nov 17, 2020
Reinforcement Learning in Robotics参考文献 39被引用 8
一句话总结

该论文提出DREM方法,通过多模态观测(如图像和触觉反馈)在无需对抗训练的情况下,学习接触丰富的操作任务中的密集奖励函数。通过利用单个专家示范的自监督反向采样,DREM学习到一种潜在的任务进展表征,从而实现样本高效的强化学习,在插销入孔和USB插入任务中优于基线方法。

ABSTRACT

Rewards play a crucial role in reinforcement learning. To arrive at the desired policy, the design of a suitable reward function often requires significant domain expertise as well as trial-and-error. Here, we aim to minimize the effort involved in designing reward functions for contact-rich manipulation tasks. In particular, we provide an approach capable of extracting dense reward functions algorithmically from robots' high-dimensional observations, such as images and tactile feedback. In contrast to state-of-the-art high-dimensional reward learning methodologies, our approach does not leverage adversarial training, and is thus less prone to the associated training instabilities. Instead, our approach learns rewards by estimating task progress in a self-supervised manner. We demonstrate the effectiveness and efficiency of our approach on two contact-rich manipulation tasks, namely, peg-in-hole and USB insertion. The experimental results indicate that the policies trained with the learned reward function achieves better performance and faster convergence compared to the baselines.

研究动机与目标

  • 减少在接触丰富的机器人操作任务中设计密集奖励函数所需的手动工作量。
  • 在不依赖对抗训练的前提下,实现从高维多模态观测(如视觉和触觉反馈)中学习密集奖励。
  • 开发一种自监督的数据采集方法,仅使用单个专家示范即可生成训练数据。
  • 通过从观测中学习任务进展代理,提升强化学习中的样本效率和收敛速度。
  • 实现学习到的奖励函数与标准强化学习算法在复杂操作任务中的无缝集成。

提出的方法

  • DREM使用反向采样策略,从目标状态开始,生成观测与估计任务进展配对的数据集。
  • 它训练一个编码器-解码器网络,将高维观测映射到表示任务进展的潜在空间,作为密集奖励信号。
  • 该方法通过自监督和单个专家轨迹定义进展标签,避免了对抗训练。
  • 任务进展被建模为到目标距离的连续单调代理,通过潜在空间中的对比学习进行学习。
  • 学习到的奖励函数与标准强化学习算法(如Soft Actor-Critic)结合,用于训练策略。
  • 该方法设计用于可扩展至视觉和触觉传感中常见的高维连续观测空间。

实验结果

研究问题

  • RQ1能否在不使用对抗训练的情况下,从高维多模态观测中学习密集奖励函数?
  • RQ2仅使用一个专家示范是否足以通过自监督数据采集生成有效的密集奖励?
  • RQ3学习潜在的任务进展表征是否能提升接触丰富操作任务中的样本效率和收敛性?
  • RQ4在真实机器人任务中,DREM的性能与手工设计和对抗训练的奖励函数相比如何?
  • RQ5学习到的奖励函数能否捕捉任务特定概念,如“接触中”或“脱离接触”?

主要发现

  • 使用DREM学习到的奖励函数训练的策略,在插销入孔和USB插入任务中,收敛速度更快,性能优于使用手工设计或对抗学习奖励的策略。
  • 该方法仅需一个专家示范即可生成有效的密集奖励,显著降低了数据和标注成本。
  • DREM的自监督采样过程高效生成了多样化的训练数据,无需大规模专家轨迹。
  • 学习到的奖励函数对高维观测(包括图像和触觉反馈)表现出鲁棒性,支持有效策略学习。
  • DREM学习到的潜在空间捕捉到了有意义的任务进展动态,包括物理接触状态如“接触中”和“脱离接触”。
  • 实验表明,DREM在最终任务成功率和训练样本效率方面均优于当前最先进的奖励学习基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。