[論文レビュー] Watch and Match: Supercharging Imitation with Regularized Optimal Transport
この論文では、行動乗法(BC)の事前学習と最適輸送(OT)を用いた適応的で軌道マッチング型報酬を組み合わせることで、政策学習の高速化を図る、新しい模倣学習アルゴリズムである正則化最適輸送(ROT)を提案する。ソフトQフィルタリング正則化を用いることで、BCの忠実度と探索の動的バランスを図り、シミュレーションでは90%のエキスパート性能に到達するまでの収束が7.8倍速くなり、1つのデモと1時間のオンライン学習で、現実世界のロボット操作タスクにおいて平均90.1%の成功率を達成した。
Imitation learning holds tremendous promise in learning policies efficiently for complex decision making problems. Current state-of-the-art algorithms often use inverse reinforcement learning (IRL), where given a set of expert demonstrations, an agent alternatively infers a reward function and the associated optimal policy. However, such IRL approaches often require substantial online interactions for complex control problems. In this work, we present Regularized Optimal Transport (ROT), a new imitation learning algorithm that builds on recent advances in optimal transport based trajectory-matching. Our key technical insight is that adaptively combining trajectory-matching rewards with behavior cloning can significantly accelerate imitation even with only a few demonstrations. Our experiments on 20 visual control tasks across the DeepMind Control Suite, the OpenAI Robotics Suite, and the Meta-World Benchmark demonstrate an average of 7.8X faster imitation to reach 90% of expert performance compared to prior state-of-the-art methods. On real-world robotic manipulation, with just one demonstration and an hour of online training, ROT achieves an average success rate of 90.1% across 14 tasks.
研究の動機と目的
- 複雑な制御タスクにおいて、多数のオンライン相互作用を必要とする逆強化学習(IRL)手法のサンプル非効率性を解消すること。
- 政策更新に伴う分布シフトと高分散の政策勾配によるIRL学習の不安定性を克服すること。
- オフラインの行動乗法とオンラインの軌道マッチング報酬を組み合わせることで、模倣学習のサンプル効率を向上させること。
- 高次元の視覚的観測と最小限のハイパーパrameterチューニングに耐えうる手法を開発すること。
- 最小限のデモとオンラインロールアウトで、高速かつロバストな現実世界ロボティクスにおける模倣学習を可能にすること。
提案手法
- オンライン探索の必要性を減らすために、エキスパートデモ上で行動乗法(BC)ポリシーを事前学習する。
- 最適輸送(OT)を用いて非パrametricな軌道マッチング報酬を計算し、オンラインポリシー最適化をガイドする。
- BCポリシーへの近接性と探索の両立を動的に制御する、適応的正則化スキーム「ソフトQフィルタリング」を導入する。
- IRLの目的関数を、事前学習済みBCポリシーからの大きな逸脱をペナルティ化する正則化最適化問題として定式化する。
- 手動の減衰スケジュールを避けるために、BCの影響を時間経過とともに徐々に弱める、学習可能な重み付け機構を用いて正則化を適用する。
- OTベースの報酬とソフトQフィルタリング正則化を用いて、オフポリシー強化学習(例:DrQ-v2)をエンドツーエンドで訓練する。
実験結果
リサーチクエスチョン
- RQ1行動乗法の事前学習とOTベースの報酬を組み合わせることで、複雑な制御タスクにおける模倣学習の高速化が顕著に達成できるか?
- RQ2固定または手動でチューニングされた正則化スケジュールと比較して、適応的正則化(ソフトQフィルタリング)はIRL学習の安定性にどのように寄与するか?
- RQ3敵対的IRLや手動で設計された報酬を用いた標準的なRLと比較して、OTベースの報酬計算はどの程度サンプル効率を向上させるか?
- RQ4提案手法は、1つのデモと最小限のオンライン相互作用で、現実世界のロボット操作タスクにおいて高い性能を達成できるか?
- RQ5事前学習と正則化の両者が、模倣学習におけるサンプル効率に果たす相対的寄与度は何か?
主な発見
- ROTは、DeepMind Control Suite、OpenAI Robotics Suite、Meta-World Benchmarkの20のシミュレーテッド視覚制御タスクにおいて、最先端のベースラインと比較して、90%のエキスパート性能に到達するまでの収束が7.8倍速くなった。
- 1つの人間デモと1時間のオンライン学習で、14のタスクにおいて現実世界のロボット操作タスクで平均90.1%の成功率を達成した。これは、行動乗法(36.1%)や敵対的IRL(14.6%)を著しく上回った。
- 明示的なタスク固有の報酬設計を必要とする標準的な深層強化学習(例:DrQ-v2)と比較して、ROTは優れた性能を示した。OTと正則化を用いた模倣学習が、報酬ベースのRLと同等またはそれを上回ることを示した。
- アブレーションスタディにより、BC事前学習とソフトQフィルタリング正則化の両方が不可欠であることが確認された。両者のいずれかを除去すると、顕著な性能低下が生じた。
- ソフトQフィルタリング機構は、手動でチューニングされた減衰スケジュールよりも安定した学習を実現し、ハイパーパrameterチューニングなしで高速収束を可能にした。
- OTベースの報酬は、敵対的IRLよりも効果的であり、正則化と組み合わせても、より安定的かつ効率的な学習を生み出した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。