[論文レビュー] Robust Domain Randomised Reinforcement Learning through Peer-to-Peer Distillation
本稿では、複数の強化学習エージェントが異なるランダム化環境で局所的に学習し、KLダイバージェンスに基づく相互正則化を通じて知識を共有するオンライン蒸留フレームワーク「ピアツーピア蒸着強化学習(P2PDRL)」を提案する。P2PDRLは、グローバルポリシーを必要とせず追加の推論コストも発生させないため、中央集権的蒸着やベースライン手法と比較して、多様なドメインにおいて優れたロバストネスと一般化性能を達成する。
In reinforcement learning, domain randomisation is an increasingly popular technique for learning more general policies that are robust to domain-shifts at deployment. However, naively aggregating information from randomised domains may lead to high variance in gradient estimation and unstable learning process. To address this issue, we present a peer-to-peer online distillation strategy for RL termed P2PDRL, where multiple workers are each assigned to a different environment, and exchange knowledge through mutual regularisation based on Kullback-Leibler divergence. Our experiments on continuous control tasks show that P2PDRL enables robust learning across a wider randomisation distribution than baselines, and more robust generalisation to new environments at testing.
研究の動機と目的
- 広範なランダム化分布に起因するドメインランダム化強化学習における高い分散と不安定性を解消すること。
- 中央集権的蒸着を用いずにエージェント間の知識共有を可能にすることで、未観測環境へのゼロショット一般化を向上させること。
- 相互正則化を通じてポリシーのロバストネスを向上させる分散型でオンラインの蒸着メカニズムを構築すること。
- ピアツーピア蒸着が中央集権的蒸着や標準的なPPOを上回ることを実証すること、特にサンプル効率性と一般化能力の面で。
提案手法
- P2PDRLは、環境のダイナミクスまたは観測パラメータの異なるランダマイズドバージョンを用いて学習するK個の並列RLエージェントを採用する。
- 各エージェントは、ポリシーの改善のための標準的なPPO損失と、行動分布間の期待Kullback–Leibler(KL)ダイバージェンスに基づくピアツーピア蒸着損失を最適化する。
- 蒸着損失は、エージェント同士が互いの予測と一致するよう促進し、グローバルポリシーが存在しない状況でも知識伝達を可能にする。
- この手法はオンラインで動作し、各エージェントはローカルな経験と相互正則化のみを用いてポリシーを更新する。
- グローバルポリシーの学習を必要としないため、中央集権的蒸着に伴う計算コストの増加を回避する。
- 固定されたトレーニング用ランダム化強度(ε^tr=0.2)を用いた連続制御タスクで評価を行い、テスト時のドメイン多様性の変化(ε^te)に応じた一般化性能を検証する。
実験結果
リサーチクエスチョン
- RQ1ピアツーピア蒸着は、ドメインランダム化強化学習におけるサンプル効率性と学習安定性を向上させることができるか?
- RQ2オンラインで分散型の蒸着は、中央集権的蒸着や標準PPOと比較して、未観測環境への一般化性能を向上させるか?
- RQ3トレーニングドメイン分布の多様性が増加するに従い、P2PDRLの性能はどのようにスケーリングするか?
- RQ4エージェントの予測同士のKLダイバージェンスによる相互正則化は、ドメインシフトに対するロバストネスを向上させるか?
主な発見
- P2PDRLは、Walker, Ant, Humanoid, Hopper, HalfCheetahの5つの連続制御タスクにおいて、バニラPPOおよびDnCと比較して、すべてのタスクでより高い漸近的性能を達成する。
- P2PDRLはベースラインと比較して、特にAntおよびHalfCheetahにおいてより高いサンプル効率性を示し、トレーニング曲線の収束が速いことが確認された。
- P2PDRLは、テスト時のドメインシフトの度合い(ε^te)が異なる状況下でも、PPOおよびDnCと比較して顕著に優れた一般化性能を示し、転移性能に優れている。
- P2PDRLのテストリターンは、トレーニング時のドメイン多様性(ε^trまで0.5)が高くなっても安定しており、PPOの性能はε^tr=0.5を超えると急激に低下する。
- P2PDRLは中央集権的蒸着ステップを必要とせず、計算コストを削減しながらもロバストネスを向上させている。
- 本手法は、特に高いドメインシフト条件下で、トレーニング効率性およびゼロショット一般化性能の両面で一貫した改善を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。