[論文レビュー] Learning Sparse Rewarded Tasks from Sub-Optimal Demonstrations
本稿では、自己生成軌道と専門家のデモンストレーションを組み合わせることで、スパarsely報酬が与えられる環境において高いサンプル効率を達成し、劣化した教師ポリシーを上回る性能を発揮する、オフポリシーな模倣学習手法である自己適応的模倣学習(SAIL)を提案する。SAILは、模倣と探索のバランスを取る動的な、探索を促進する目的関数を用い、識別器に基づく合成報酬を用いて、劣化したデモンストレーションを次々と優れた自己生成軌道に置き換えることで、連続的制御ベンチマーク全体でほぼ最適な性能を達成する。
Model-free deep reinforcement learning (RL) has demonstrated its superiority on many complex sequential decision-making problems. However, heavy dependence on dense rewards and high sample-complexity impedes the wide adoption of these methods in real-world scenarios. On the other hand, imitation learning (IL) learns effectively in sparse-rewarded tasks by leveraging the existing expert demonstrations. In practice, collecting a sufficient amount of expert demonstrations can be prohibitively expensive, and the quality of demonstrations typically limits the performance of the learning policy. In this work, we propose Self-Adaptive Imitation Learning (SAIL) that can achieve (near) optimal performance given only a limited number of sub-optimal demonstrations for highly challenging sparse reward tasks. SAIL bridges the advantages of IL and RL to reduce the sample complexity substantially, by effectively exploiting sup-optimal demonstrations and efficiently exploring the environment to surpass the demonstrated performance. Extensive empirical results show that not only does SAIL significantly improve the sample-efficiency but also leads to much better final performance across different continuous control tasks, comparing to the state-of-the-art.
研究の動機と目的
- スパarsely報酬が与えられる環境において、限られた劣化した専門家のデモンストレーションしか入手できない状況で強化学習エージェントを訓練するという課題に対処すること。
- 高品質または最適な専門家データを必要とせずに、専門家のデモンストレーションを活用することで、モデルフリー強化学習におけるサンプル複雑性を低減すること。
- スパarsely報酬の環境において、環境報酬に基づく体系的な探索を用いて、劣化したデモンストレーションの性能を上回るエージェントを実現すること。
- 模倣学習の行動と、より高い報酬を得る可能性のある新しい軌道の探索の両方を動的にバランス取る目的関数を設計すること。
提案手法
- SAILは、劣化したデモンストレーションに過剰適合しないように、分布マッチングと従来のポリシーからの逸脱を促進する探索駆動型の目的関数を組み合わせた二重目的の学習プロセスを定式化する。
- 識別器を用いて、専門家のデモンストレーションと自己生成軌道の間の占有測度の一致に基づき、真の環境報酬にアクセスせずに報酬形状を可能にする合成報酬信号を生成する。
- オフポリシーのアクタクリティックフレームワークを採用することで、専門家のデモンストレーションと自己生成経験の両方を効率的に活用し、分布シフトを是正するための重要度サンプリングを用いる。
- 劣化したデモンストレーションを、スパarsely報酬に基づいて高い報酬を得る自己生成軌道に置き換える動的なデモンストレーション置き換えメカニズムを実装する。
- エージェントは、現在の教師ポリシー分布の模倣と、より優れたポリシーを発見するための探索を交互に繰り返すことで、段階的に目標ポリシーを改善する。
- 正規化された定常状態-行動分布 $ d_{\pi} $ を用いてポリシーの目的関数を定義し、初期段階の学習で専門家のデモンストレーションを自然に優先する報酬関数を用いる。
実験結果
リサーチクエスチョン
- RQ1劣化した専門家のデモンストレーションしか入手できない状況で、模倣学習手法がほぼ最適な性能を達成できるか?
- RQ2密度の高い報酬信号に依存せずに、スパarsely報酬環境における探索を効果的に誘導する方法は何か?
- RQ3模倣学習の行動と、より高い報酬を得る可能性のある新しい軌道の探索の最適なトレードオフは何か?
- RQ4優れた自己生成軌道に置き換える動的かつ適応的なデモンストレーション置き換えが、教師ポリシーを上回る性能をもたらすか?
- RQ5劣化した品質のデモンストレーションに対してロバストでありながら、オフポリシー模倣学習のサンプル効率をどのように向上できるか?
主な発見
- SAILは、スパarsely報酬が与えられる連続的制御タスクにおいて、最先端の手法と比較して顕著に高いサンプル効率を達成する。
- 限定的な劣化したデモンストレーションしか入手できない状況でも、SAILはほぼ最適な性能を達成し、教師ポリシーの性能を上回る。
- 複数のベンチマーク環境において、SAILは既存の模倣学習および強化学習ベースラインを、最終的な漸近的報酬の観点で上回る。
- 高い報酬を得る自己生成軌道に置き換える動的なデモンストレーション置き換えは、時間経過とともに一貫した性能向上をもたらす。
- 識別器に基づく合成報酬の使用により、真の環境報酬にアクセスせずに効果的な探索が可能になる。
- 実験的結果から、SAILは劣化したデモンストレーションによる性能低下を回避し、安定した学習を維持することが示された。これは、標準的なIL手法とは対照的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。