Skip to main content
QUICK REVIEW

[论文解读] Deep Learning with Experience Ranking Convolutional Neural Network for Robot Manipulator

Van‐Dinh Nguyen, Hung Manh La|arXiv (Cornell University)|Sep 16, 2018
Reinforcement Learning in Robotics参考文献 21被引用 4
一句话总结

本文提出了一种经验排序卷积神经网络(ER-CNN),通过优先处理高奖励、高质量的经验来增强机器人操作任务中DDPG + HER强化学习的性能。通过使用预训练的CNN基于视觉和任务相关特征对轨迹进行排序,该方法加速了学习收敛并提升了最终性能,在门推开任务中实现了100%的成功率,并在复杂任务中将训练轨迹数量减少了三分之二。

ABSTRACT

Supervised learning, more specifically Convolutional Neural Networks (CNN), has surpassed human ability in some visual recognition tasks such as detection of traffic signs, faces and handwritten numbers. On the other hand, even state-of-the-art reinforcement learning (RL) methods have difficulties in environments with sparse and binary rewards. They requires manually shaping reward functions, which might be challenging to come up with. These tasks, however, are trivial to human. One of the reasons that human are better learners in these tasks is that we are embedded with much prior knowledge of the world. These knowledge might be either embedded in our genes or learned from imitation - a type of supervised learning. For that reason, the best way to narrow the gap between machine and human learning ability should be to mimic how we learn so well in various tasks by a combination of RL and supervised learning. Our method, which integrates Deep Deterministic Policy Gradients and Hindsight Experience Replay (RL method specifically dealing with sparse rewards) with an experience ranking CNN, provides a significant speedup over the learning curve on simulated robotics tasks. Experience ranking allows high-reward transitions to be replayed more frequently, and therefore help learn more efficiently. Our proposed approach can also speed up learning in any other tasks that provide additional information for experience ranking.

研究动机与目标

  • 解决机器人强化学习中稀疏且二值化奖励的挑战,因为标准方法因缺乏学习信号而表现不佳。
  • 克服Hindsight Experience Replay(HER)中固定经验重放缓冲策略的局限性,后者对所有经验一视同仁,不考虑其质量。
  • 通过引入一种学习得到的、与任务相关的经验选择评估机制,提升样本效率和学习速度。
  • 证明将先验知识(通过预训练CNN实现)嵌入学习过程,可显著加速并稳定机器人任务中的策略学习。

提出的方法

  • 将深度确定性策略梯度(DDPG)与Hindsight Experience Replay(HER)结合,以处理机器人操作中的稀疏奖励问题。
  • 训练一个独立的、预训练的卷积神经网络(ER-CNN),基于视觉和任务相关特征对整个训练轨迹进行评估与排序。
  • 利用ER-CNN的输出得分决定是否将某段轨迹存入经验回放缓冲区,仅保留高分轨迹。
  • 实施一种过滤机制,丢弃低分经验(例如排名>4的轨迹),以防止低质量数据降低学习性能。
  • 在四个MuJoCo机器人任务中应用排序后的经验回放:门推开、fetch滑动、fetch推动和fetch抓取与放置。
  • 使用图像特征(如到目标物体的距离、门把手存在性、铰链角度)作为ER-CNN的输入,用于轨迹评估。

实验结果

研究问题

  • RQ1基于学习的、外部的CNN排序系统是否能提升DDPG + HER在稀疏奖励机器人操作任务中的样本效率?
  • RQ2基于视觉和任务特定特征的经验排序方法,与均匀分布或TD-error-based重放缓冲策略相比,在学习速度和最终性能上表现如何?
  • RQ3预训练视觉模型在多大程度上可减少复杂机器人控制任务中达到收敛所需的轨迹数量?
  • RQ4通过ER-CNN过滤低质量经验是否能带来比标准HER更稳定且更高的最终成功率?
  • RQ5所提出的方法是否能在测试环境之外的多样化机器人操作任务中实现泛化?

主要发现

  • ER-CNN方法在门推开任务中实现了100%的中位数成功率,显著优于原始DDPG + HER方法,后者在收敛时无法维持高精度。
  • 在FetchPush-v1任务中,所提方法仅需原始DDPG + HER一半的轨迹数量即可收敛。
  • 在更复杂的FetchPick&Place-v1任务中,该方法将所需训练轨迹数量减少至原始DDPG + HER基线的三分之一。
  • 基于ER-CNN的排序系统提升了学习鲁棒性,四款仿真任务中均实现了更快的收敛速度和更稳定的表现。
  • 即使使用在真实世界训练的ER-CNN(准确率为80.2%)而非理想分类器,该方法在学习速度和最终性能上仍优于原始DDPG + HER。
  • 结果表明,优先处理高质量、视觉信息丰富的经验,可显著提升稀疏奖励环境中策略学习的效率与稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。