Skip to main content
QUICK REVIEW

[論文レビュー] Mitigating Covariate Shift in Imitation Learning via Offline Data Without Great Coverage

Jonathan Chang, Masatoshi Uehara|arXiv (Cornell University)|Jun 6, 2021
Reinforcement Learning in Robotics参考文献 81被引用数 7
ひとこと要約

この論文は、部分的かつ不完全な専門家軌道カバレッジを持つ静的オフラインデータセットのみを用いて、状態遷移の分布シフトを軽減するモデルベースのオフライン模倣学習フレームワークMILOを提案する。行動方策が著しく劣っている状況下でも、専門家データの半分未満で高忠実度の模倣を達成し、従来の行動クラッシングを上回る性能を示す。

ABSTRACT

This paper studies offline Imitation Learning (IL) where an agent learns to imitate an expert demonstrator without additional online environment interactions. Instead, the learner is presented with a static offline dataset of state-action-next state transition triples from a potentially less proficient behavior policy. We introduce Model-based IL from Offline data (MILO): an algorithmic framework that utilizes the static dataset to solve the offline IL problem efficiently both in theory and in practice. In theory, even if the behavior policy is highly sub-optimal compared to the expert, we show that as long as the data from the behavior policy provides sufficient coverage on the expert state-action traces (and with no necessity for a global coverage over the entire state-action space), MILO can provably combat the covariate shift issue in IL. Complementing our theory results, we also demonstrate that a practical implementation of our approach mitigates covariate shift on benchmark MuJoCo continuous control tasks. We demonstrate that with behavior policies whose performances are less than half of that of the expert, MILO still successfully imitates with an extremely low number of expert state-action pairs while traditional offline IL method such as behavior cloning (BC) fails completely. Source code is provided at https://github.com/jdchang1/milo.

研究の動機と目的

  • オンライン環境相互作用やグローバルにカバーされた専門家分布を必要とせずに、模倣学習における分布シフトを解消すること。
  • 行動方策が劣っていても動作する理論的裏付けのあるモデルベースのオフラインILフレームワークを構築すること。
  • オフラインデータに含まれる専門家軌道の部分的カバレッジが、成功した模倣に十分であることを示すこと。
  • ニューラルネットワークアンサンブルとディスクライマ型コスト関数を活用した、頑健なオフライン模倣に適した実用的アルゴリズムを提供すること。
  • 専門家データが極めて限られた状況下でも、従来のオフラインIL手法(例:行動クラッシング)を上回ることを示すこと。

提案手法

  • MILOは、静的オフラインデータセット(状態-行動-次状態遷移)から学習された動的モデルを用いて、専門家に類似したロールアウトをシミュレートする。
  • ランダムフォーリエ特徴量を用いて、専門家行動と行動方策行動を区別するディスクライマ型コスト関数を採用する。
  • モデルアンサンブルの不確実性に基づくペナルティ項を組み込み、予測分散が大きい領域での行動を抑制する。
  • 専門家模倣(ディスクライマ損失を介して)と行動クラッシング正則化を組み合わせたハイブリッド目的関数により、学習の安定化を図る。
  • 信頼領域方策最適化(TRPO)を用いて方策を最適化し、KLダイバージェンス制約により方策更新の安定性を保証する。
  • 専門家識別と不確実性正則化のバランスを取るために、学習可能なペナルティ重みを用いてコスト関数を動的に調整する。

実験結果

リサーチクエスチョン

  • RQ1行動方策が劣っていても、専門家状態-行動ペアの部分的カバレッジがある場合に、オフライン模倣学習が高忠実度の模倣を達成できるか?
  • RQ2オンライン環境相互作用や状態-行動空間の完全カバレッジを必要とせずに、オフラインILにおける分布シフトを軽減できるか?
  • RQ3不確実性を考慮したコスト関数を備えたモデルベースアプローチは、データが少ない模倣設定における一般化性能を向上させるか?
  • RQ4専門家データが極めて限られた状況下で、MILOは行動クラッシングや他のオフラインIL手法と比べてどのように性能を発揮するか?
  • RQ51つの専門家軌道入力のみでも、MILOは多様なMuJoCo連続制御環境に一般化可能か?

主な発見

  • MILOは、行動方策が専門家の46%の性能(Humanoid-v2では1505 ± 473 vs. 3248)にとどまる状況下でも、専門家方策を高忠実度で模倣した。
  • 専門家状態-行動ペアがたった100組の状況下でも、MILOは専門家と同等の性能を達成したが、行動クラッシングは完全に失敗した。
  • Hopper、Walker2d、HalfCheetah、Ant、Humanoidを含むすべてのMuJoCo環境で、MILOは極めて少ない専門家データでも強固な性能を維持した。
  • 単一の専門家軌道入力に対してもMILOは良好に一般化し、全タスクで専門家と同等またはほぼ同等の性能を達成した。
  • 不確実性を考慮したコスト関数の導入により、行動クラッシングが失敗するようなデータが少ない状況下でも、著しく頑健性が向上した。
  • Hopper-v2でのハイパーパramータチューニングの結果が、他の環境へも効果的に一般化された。これは、本手法の転送可能性と安定性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。