[論文レビュー] Actionable Models: Unsupervised Offline Reinforcement Learning of Robotic Skills
この論文では、報酬やオンライン相互作用なしに、オффラインで収集された現実のロボットデータから、ゴール条件付きポリシーを学習するための「Actionable Models」を提案する。ゴール条件付きQ学習にヒンディー・リラベルリングと合成された負の行動正則化を組み合わせることで、未学習のタスクへのゼロショット一般化、長時間スケジューリングのゴールチェーン、画像観測値を用いた現実のロボットにおける事前学習や補助目的による下流の強化学習の向上を実現する。
We consider the problem of learning useful robotic skills from previously collected offline data without access to manually specified rewards or additional online exploration, a setting that is becoming increasingly important for scaling robot learning by reusing past robotic data. In particular, we propose the objective of learning a functional understanding of the environment by learning to reach any goal state in a given dataset. We employ goal-conditioned Q-learning with hindsight relabeling and develop several techniques that enable training in a particularly challenging offline setting. We find that our method can operate on high-dimensional camera images and learn a variety of skills on real robots that generalize to previously unseen scenes and objects. We also show that our method can learn to reach long-horizon goals across multiple episodes through goal chaining, and learn rich representations that can help with downstream tasks through pre-training or auxiliary objectives. The videos of our experiments can be found at https://actionable-models.github.io
研究の動機と目的
- 手動で設計された報酬やオンライン探索を必要とせず、事前に収集されたオフラインデータから多様なロボットスキルを学習すること。
- データセット内のすべての状態を潜在的なゴールとみなすことで、自動的に多様なタスクを合成する汎用的な学習目的を開発すること。
- 未学習の行動に対する合成された負のラベルを用いて、オフラインでゴール条件付き強化学習の訓練を安定化させること。
- 複数のエピソードにまたがるゴールチェーンを用いて長時間のスキルを学習可能にすること。
- 事前学習されたActionable Modelsが微調整や補助目的を通じて下流タスク学習をどのように加速するかを示すこと。
提案手法
- ヒンディー・リラベルリングを用いたゴール条件付きQ学習を採用し、データセット内の任意のゴール状態に到達可能なポリシーを訓練する。
- 未学習の行動に対して低Q値を割り当てる正則化技術を導入し、オフライン強化学習における分布シフトと過大評価を緩和する。
- 状態とゴールの両方に画像観測値を用いることで、手動で設計された報酬関数や距離メトリクスの必要性を排除する。
- 中間ゴールをウェイポイントとして用いることで、複数エピソードにまたがるゴールをチェーン化し、長時間のスキル学習を可能にする。
- 下流タスク学習のための事前学習または補助目的として、事前学習済みのゴール条件付きポリシーを活用する。
- 少量のオンラインデータとタスク固有の報酬を用いて微調整することで、サンプル効率を向上させる。
実験結果
リサーチクエスチョン
- RQ1手動で指定された報酬がなく、オンライン相互作用なしにオフラインで収集された現実のロボットデータから、ゴール条件付き強化学習を効果的に訓練できるか?
- RQ2オンライン相互作用なしに、オフラインのゴール条件付き強化学習における分布シフトと過大評価をどのように緩和できるか?
- RQ31つのオフラインデータセットから、多様で一般化可能なスキルを1つのモデルが学習可能か?
- RQ4ゴールチェーンは、データセット内で最も長い軌道をはるかに超える複数エピソードにまたがるゴールに到達可能か?
- RQ5微調整や補助目的を通じて、事前学習されたActionable Modelsが下流タスク学習をどの程度加速できるか?
主な発見
- 微調整に10,000エピソード未満を用いた後、3つの現実のインスタンス・グラッピングタスクで少なくとも20%の成功率を達成した一方、標準的なオフラインQT-Optは5%未満に留まった。
- ゴール到達目的による事前学習は、シミュレーションおよび現実世界の両方で下流の強化学習訓練を顕著に加速した。
- オンライン学習中に補助的なゴール到達目的を用いることで、標準的なQT-Optに比べて学習時間を短縮し、サンプル効率が向上した。
- モデルは未学習のシーンや物体に対しても一般化でき、視覚的に示されたゴールからのゼロショット一般化を示した。
- ゴールチェーンにより、複数エピソードにまたがるデータセットのセグメントを組み合わせて、長時間のゴールに到達可能となった。
- Actionable Modelsが学習した表現は、下流タスクの特徴として有効であり、事前学習または補助目的として使用することで性能向上を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。