[論文レビュー] MoDem: Accelerating Visual Model-Based Reinforcement Learning with Demonstrations
MoDemは、わずか5件の専門家デモンストレーションを活用することで、視覚モデルベース強化学習の高速化を図る3段階フレームワークを提案する。ポリシーの事前学習、専門家による優先順位付けられたロールアウトで世界モデルを初期化し、モデル学習中にデモンストレーションデータを積極的にオーバースマplingすることで、100K回の環境インタラクションで、報酬がスパarsな視覚制御タスクにおいて、先行手法よりも160%〜250%高い成功率を達成する。
Poor sample efficiency continues to be the primary challenge for deployment of deep Reinforcement Learning (RL) algorithms for real-world applications, and in particular for visuo-motor control. Model-based RL has the potential to be highly sample efficient by concurrently learning a world model and using synthetic rollouts for planning and policy improvement. However, in practice, sample-efficient learning with model-based RL is bottlenecked by the exploration challenge. In this work, we find that leveraging just a handful of demonstrations can dramatically improve the sample-efficiency of model-based RL. Simply appending demonstrations to the interaction dataset, however, does not suffice. We identify key ingredients for leveraging demonstrations in model learning -- policy pretraining, targeted exploration, and oversampling of demonstration data -- which forms the three phases of our model-based RL framework. We empirically study three complex visuo-motor control domains and find that our method is 150%-250% more successful in completing sparse reward tasks compared to prior approaches in the low data regime (100K interaction steps, 5 demonstrations). Code and videos are available at: https://nicklashansen.github.io/modemrl
研究の動機と目的
- 現実世界の視覚運動制御タスクにおける視覚モデルベース強化学習(MBRL)の低いサンプル効率を改善すること。
- 標準のリプレイバッファ統合が失敗する状況において、少数の専門家デモンストレーションがMBRLをどのように加速できるかを調査すること。
- デモンストレーションを効果的に活用し、世界モデルの品質とポリシー学習を向上させる構造的で3段階のフレームワークを開発すること。
- デモンストレーションのナチュラルな統合とは異なり、ポリシーの事前学習と積極的なデモンストレーションデータオーバースマplingがMBRLで顕著に優れていることを実証すること。
提案手法
- 段階1:少数の専門家デモンストレーション上で行動クラーニング(BC)を用いて視覚表現とポリシーを事前学習する。
- 段階2:事前学習済みポリシーを用いて探索を行い、世界モデルとクライミックの事前学習用に的を射た高品質なデータセットを生成する。
- 段階3:合成ロールアウトと3段階すべてのデータを用いて、ポリシーと世界モデルを共同で微調整し、デモンストレーション遷移を積極的にオーバースマplingする。
- モデルの正則化と一般化性能の向上のため、段階間でデータ拡張と重み共有を適用する。
- 共同最適化中にポリシーと世界モデルの学習を分離するために、ストップ・グラデント演算子を用いる。
- デモンストレーションをロールアウトとして統合するのではなく、的を射たデータサンプリングを通じて世界モデルの監視の根幹とする。
実験結果
リサーチクエスチョン
- RQ1少数の専門家デモンストレーションが、視覚モデルベースRLのサンプル効率を顕著に向上させ得るか?
- RQ2リプレイバッファにデモンストレーションを単純に追加する方法が、なぜMBRLの加速に失敗するのか?
- RQ3MBRLでデモンストレーションを効果的に活用するには、どのようなアーキテクチャ的および訓練的要素が必要か?
- RQ4事前学習済みポリシーからのポリシーの事前学習と的を射たデータ収集が、世界モデルとクライミックの学習をどのように向上させるか?
- RQ5データ拡張とデモンストレーションのオーバースマplingは、視覚MBRLのパフォーマンスをどの程度向上させ得るか?
主な発見
- MoDemは、100K回の環境インタラクションと5件のデモンストレーションで、21の挑戦的視覚運動制御タスクにおいて、先行する最先端手法よりも160%〜250%高い成功率を達成する。
- リプレイバッファにデモンストレーションを単純に追加するだけでは、エージェントが行動の事前知識を効果的に活用できず、性能が著しく劣化する。
- ポリシーの事前学習、専門家による優先順位付けられたロールアウトによる初期化、インタラクティブな微調整という3段階フレームワークにより、安定的かつ単調に学習が進行する。
- 世界モデル学習中にデモンストレーションデータを積極的にオーバースマplingすることで、モデルの正確性と下流のポリシー成功確率が顕著に向上する。
- データ拡張と事前学習済みの視覚表現により、低データ環境での学習コストが低下し、耐障害性が向上する。
- モデルフリーのベースラインと比較して大幅に優れた性能を示しており、報酬がスパarsな設定において、デモンストレーションを用いたMBRLがモデルフリーの代替手段よりもはるかにサンプル効率が良いことを実証している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。