Skip to main content
QUICK REVIEW

[論文レビュー] Learning Dense Rewards for Contact-Rich Manipulation Tasks

Zheng Wu, Wenzhao Lian|arXiv (Cornell University)|Nov 17, 2020
Reinforcement Learning in Robotics参考文献 39被引用数 8
ひとこと要約

本稿では、敵対的訓練を用いずに、画像やタクトイルフィードバックなどのマルチモodal観測を用いて接触を伴う操作タスクのための密集型報酬関数を学習する手法DREMを提案する。1つのエキスパートデモから自己教師付きのバックワードサンプリングを活用することで、DREMはタスク進行度を表す潜在表現を学習し、サンプル効率の高い強化学習を可能にする。この手法は、ペグインホールおよびUSB挿入タスクにおいて、ベースラインを上回る性能を発揮する。

ABSTRACT

Rewards play a crucial role in reinforcement learning. To arrive at the desired policy, the design of a suitable reward function often requires significant domain expertise as well as trial-and-error. Here, we aim to minimize the effort involved in designing reward functions for contact-rich manipulation tasks. In particular, we provide an approach capable of extracting dense reward functions algorithmically from robots' high-dimensional observations, such as images and tactile feedback. In contrast to state-of-the-art high-dimensional reward learning methodologies, our approach does not leverage adversarial training, and is thus less prone to the associated training instabilities. Instead, our approach learns rewards by estimating task progress in a self-supervised manner. We demonstrate the effectiveness and efficiency of our approach on two contact-rich manipulation tasks, namely, peg-in-hole and USB insertion. The experimental results indicate that the policies trained with the learned reward function achieves better performance and faster convergence compared to the baselines.

研究の動機と目的

  • 接触を伴うロボット操作タスクのための密集型報酬関数を設計する際の人的作業負荷を低減すること。
  • 敵対的訓練に依存せずに、高次元のマルチモーダル観測(例えば、視覚とタクトイルフィードバック)から密集型報酬を学習できること。
  • 1つのエキスパートトレジェリーのみを用いて、自己教師付きのデータ収集手法を開発すること。
  • 観測からタスク進行度の代理変数を学習することで、強化学習におけるサンプル効率と収束速度を向上させること。
  • 学習された報酬を、複雑な操作タスクにおける標準的なRLアルゴリズムにスムーズに統合できること。

提案手法

  • DREMは、ゴール状態から始めてバックワードサンプリング戦略を用いて、観測と推定タスク進行度のペairedデータセットを生成する。
  • 高次元の観測を、タスク進行度を表す潜在空間にマップするエンコーダ・デコーダネットワークを訓練し、これにより密集型報酬信号を提供する。
  • 敵対的訓練を避けるために、自己教師学習と1つのエキスパート軌道に基づく進行度ラベルの定義に依存する。
  • タスク進行度は、ゴールまでの距離の連続的で単調増加な代理変数としてモデル化され、潜在空間における対照的学習により学習される。
  • 学習された報酬関数は、Soft Actor-Criticなどの標準的なRLアルゴリズムと組み合わせて、ポリシーの訓練に用いられる。
  • 本手法は、視覚やタクトイルセンシングに一般的に見られる高次元連続的観測空間へスケーラブルに拡張可能である。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練を用いずに、高次元マルチモーダル観測から密集型報酬関数を学習可能か?
  • RQ2自己教師付きデータ収集により、1つのエキスパートデモで十分な密集型報酬を生成可能か?
  • RQ3潜在タスク進行度表現を学習することで、接触を伴う操作タスクにおけるサンプル効率と収束速度が向上するか?
  • RQ4DREMの性能は、手作業による報酬関数や敵対的に学習された報酬関数と比較して、実世界のロボットタスクで優れているか?
  • RQ5学習された報酬関数は、「接触中」や「接触を失った」などのタスク固有の概念を捉えられるか?

主な発見

  • ペグインホールおよびUSB挿入タスクにおいて、DREMが学習した報酬を用いて訓練されたポリシーは、手作業による報酬や敵対的に学習された報酬を用いた場合よりも収束が早く、性能が優れている。
  • 本手法は、効果的な密集型報酬を生成するために、1つのエキスパートデモのみを必要としており、データ収集コストとアノテーションコストを顕著に低減した。
  • DREMの自己教師付きサンプリングプロセスは、大規模なエキスパート軌道を必要とせず、多様な訓練データを効率的に生成した。
  • 学習された報酬関数は、画像やタクトイルフィードバックを含む高次元観測に対して頑健であり、効果的なポリシー学習を可能にした。
  • DREMが学習した潜在空間は、「接触中」や「接触を失った」などの物理的接触状態を含む意味のあるタスク進行ダイナミクスを捉えていた。
  • 実験の結果、DREMは最終的なタスク成功確率および訓練に必要なサンプル数の両面で、最先端の報酬学習ベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。