Skip to main content
QUICK REVIEW

[論文レビュー] Fully Autonomous Real-World Reinforcement Learning with Applications to Mobile Manipulation

Charles Sun, Jędrzej Orbik|arXiv (Cornell University)|Jul 28, 2021
Reinforcement Learning in Robotics被引用数 15
ひとこと要約

ReLMM は、人為的介入、環境の装備、特権情報なしで、完全に自律的かつ現実世界の強化学習を実現する。ナビゲーションと grasping ポリシーを分離し、grasp 不確実性を用いて探索を駆動することで、40時間の連続した現実世界での訓練でエンド・ツー・エンドのスキル学習を達成し、非構造的環境における有効な生涯学習を示した。

ABSTRACT

We study how robots can autonomously learn skills that require a combination of navigation and grasping. While reinforcement learning in principle provides for automated robotic skill learning, in practice reinforcement learning in the real world is challenging and often requires extensive instrumentation and supervision. Our aim is to devise a robotic reinforcement learning system for learning navigation and manipulation together, in an autonomous way without human intervention, enabling continual learning under realistic assumptions. Our proposed system, ReLMM, can learn continuously on a real-world platform without any environment instrumentation, without human intervention, and without access to privileged information, such as maps, objects positions, or a global view of the environment. Our method employs a modularized policy with components for manipulation and navigation, where manipulation policy uncertainty drives exploration for the navigation controller, and the manipulation module provides rewards for navigation. We evaluate our method on a room cleanup task, where the robot must navigate to and pick up items scattered on the floor. After a grasp curriculum training phase, ReLMM can learn navigation and grasping together fully automatically, in around 40 hours of autonomous real-world training.

研究の動機と目的

  • 人為的監視や環境装備なしで、完全に自律的な強化学習システムをモバイルマニピュレーションに開発すること。
  • オンボードセンサーや自己教師付き報酬のみを用いて、現実世界環境で継続的・生涯にわたる学習を可能にすること。
  • マップや物体位置、グローバル状態観測といった特権情報に依存しないこと。
  • ナビゲーションと grasping の効率的探索と統合的学習を可能にするモジュラーなポリシー・アーキテクチャを設計すること。
  • 人為的介入を最小限に抑えつつ性能を維持する、サンプル効率の良い自律的カリキュラム学習を実証すること。

提案手法

  • ReLMM は、ナビゲーションと grasping のコンponentsを別々に持つモジュラー・ポリシーを採用し、深層強化学習により統合的に訓練する。
  • grasping ポリシーの不確実性を探索ボーナスとして用い、ナビゲーション・ポリシーが未探索または不確実な領域へ向かうように誘導する。
  • 成功した grasps をもとにナビゲーション・ポリシーに報酬を与えるが、報酬再ラベル化機構を用いてサンプル効率を向上させる。
  • 動的 grasping 頻度スケジュールと不確実性ベースのボーナスにより、自律的カリキュラムを実装し、人為的介入を低減する。
  • 初期の grasping プレトレーニングと、その後のナビゲーション・grasping の統合訓練を段階的に行う階層的二段階訓練プロセスを採用する。
  • すべての訓練は、外部装備や人為的リセットなしにオンボードセンサのみを用いて実施する。

実験結果

リサーチクエスチョン

  • RQ1モバイルマニピュレーターは、人為的監視や環境装備なしで、現実世界環境において複雑なナビゲーションと grasping タスクを自律的に学習できるか?
  • RQ2特権状態情報なしで、統合ナビゲーション・grasping ポリシーにおける探索をどのように効果的に駆動できるか?
  • RQ3ポリシー分解とカリキュラム設計は、モバイルマニピュレーションの現実世界強化学習におけるサンプル効率にどのような影響を与えるか?
  • RQ4自律的カリキュラム学習は、人為的に設計されたカリキュラムと同等の性能を達成できるか?人為的入力は最小限に抑えられるか?
  • RQ5システムは、途切れのない継続的現実世界訓練を通じて、どの程度の生涯学習を実現できるか?

主な発見

  • ReLMM は、わずかに人為的介入を伴う40時間の連続した現実世界訓練で、部屋の片付けを成功させた。
  • 時間の経過とともに継続的に改善が見られたことから、非構造的環境における有効な生涯学習が実現された。
  • アブレーションスタディの結果、不確実性ボーナスを用いた統合訓練が、個別訓練や固定カリキュラム手法を著しく上回った。
  • プレトレーニング段階でたった1,000回の静止 grasping での学習で、妥当な部屋片付け性能が達成された。これは、サンプル効率の高さを示している。
  • 報酬再ラベル化を用いた自律的カリキュラムは、静止カリキュラムと同等の性能を達成したが、人為的作業が大幅に削減された。
  • ナビゲーションと grasping モジュールを別々に設計したポリシー分解により、ジョイントアクションスペースのポリシーと比較して、訓練の安定性と性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。