Skip to main content
QUICK REVIEW

[論文レビュー] Lifelong Robotic Reinforcement Learning by Retaining Experiences

Annie Xie, Chelsea Finn|arXiv (Cornell University)|Sep 19, 2021
Reinforcement Learning in Robotics参考文献 61被引用数 7
ひとこと要約

本論文では、過去の経験を保持し、選択的に再利用することでデータ効率を向上させる、物理的ロボット向けの生涯強化学習フレームワークを提案する。リプレイバッファ内の再ラベル付けされた過去の経験を事前学習し、ダイナミクス類似度に基づく選択的リプレイでファインチューニングすることで、各タスクを再びから学習する場合と比較して、サンプル要件を50%以上削減し、10の操作タスクにおいて実ロボットのFranka Pandaで学習効率を2倍に向上させた。

ABSTRACT

Multi-task learning ideally allows robots to acquire a diverse repertoire of useful skills. However, many multi-task reinforcement learning efforts assume the robot can collect data from all tasks at all times. In reality, the tasks that the robot learns arrive sequentially, depending on the user and the robot's current environment. In this work, we study a practical sequential multi-task RL problem that is motivated by the practical constraints of physical robotic systems, and derive an approach that effectively leverages the data and policies learned for previous tasks to cumulatively grow the robot's skill-set. In a series of simulated robotic manipulation experiments, our approach requires less than half the samples than learning each task from scratch, while avoiding impractical round-robin data collection. On a Franka Emika Panda robot arm, our approach incrementally learns ten challenging tasks, including bottle capping and block insertion.

研究の動機と目的

  • 物理的ロボットでは同時に複数のタスクに注目できないという現実的制限を解消するため、ラウンドロビン型マルチタスク強化学習の限界に対処すること。
  • 以前に収集された経験を活用することで、新しいタスクの学習を加速できる、効率的な生涯学習を可能にすること。
  • 災難的忘却を軽減するとともに、構造的な経験再利用によって前向きな転送を促進すること。
  • 目的や物理的設定が異なる現実世界のロボット操作タスクに適した、スケーラブルでデータ効率の高いフレームワークを構築すること。

提案手法

  • 新しいタスクごとに2段階のプロセスを実行する:リプレイバッファ内の再ラベル付けされた過去の経験を用いた事前学習、およびダイナミクス類似度に基づく選択的リプレイによるオンラインファインチューニング。
  • 事前学習の前に、現在のタスクの報酬関数を用いて過去の経験を再ラベル付けし、新しい目的に整合させる。
  • 過去のタスクのサンプルは、現在のタスクのダイナミクスとの類似度に基づいてフィルタリングされ、サンプル選択バイアスを是正する。
  • 過去の遷移と現在のタスクのダイナミクスとの類似度を測る指標を用いて、転送に最も関連性の高い経験を優先する。
  • 経験リプレイとポリシーネットワークの重み転送を組み合わせることで、安定性とデータ効率の両方を向上させる。
  • フレームワークは過去の経験を完全に記憶していると仮定し、前向きな転送に焦点を当てており、現実的でないラウンドロビン型データ収集を回避する。

実験結果

リサーチクエスチョン

  • RQ1以前に解決済みのタスクからの経験を、生涯学習の文脈で、新しいタスクの学習を加速するために効果的に再利用できるか?
  • RQ2ダイナミクスや報酬が異なる多様なタスクから経験を転送する際、サンプル選択バイアスをどのように軽減できるか?
  • RQ3現在のタスクのダイナミクスとの類似度に基づく選択的リプレイは、標準的な経験リプレイと比較して、データ効率と学習安定性を向上させるか?
  • RQ4経験ベースの転送は、生涯強化学習における重みベースの転送をどの程度補完できるか?
  • RQ5本フレームワークは、ラウンドロビン型データ収集を必要とせずに、現実世界のロボット操作タスクで顕著なデータ効率の向上を達成できるか?

主な発見

  • 実際のFranka Emika Pandaロボットでは、本手法は10,000ステップの環境ステップでゴールまでの平均距離を0.75 cmにまで低下させたのに対し、各タスクを再びから学習した場合の1.83 cmと比較して、著しく優れた性能を示した。
  • 10の困難な操作タスクを学習するための環境ステップ数を100,000未満にまで削減し、から学習する場合と比較して2倍の学習効率向上を達成した。
  • ダイナミクス類似度に基づいて過去の経験をフィルタリングすることで、学習効率が著しく向上した。標準的な経験リプレイでは、最適でないポリシーが得られた。
  • アブレーションスタディの結果、再ラベル付けされたデータに対する事前学習と選択的オンラインリプレイの両方が、性能向上に不可欠であり、それぞれがデータ効率に独自の貢献をしていた。
  • 再ラベル付けされた過去データを活用することで、無関係な探索ステップの数を削減し、タスクゴールへの収束をより迅速に可能にした。
  • 本フレームワークは、ボトルキャップの装着、ブロック挿入、バルブ操作など多様なタスクにおいて一貫した前向きの転送を示し、シミュレーションおよび現実世界の実験の両方で安定的かつ効率的な学習曲線を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。