[論文レビュー] Learning to Score Behaviors for Guided Policy Optimization
本稿では、学習済みの行動埋め込み空間におけるウォッサーシュタイン距離を用いて、望ましい行動へ向けたポリシーのスコア付けと誘導を行う、強化学習におけるガイド付きポリシー最適化の新規フレームワークを提案する。エントロピー正則化されたウォッサーシュタイン距離の双対定式を活用することで、行動正則化子を介した効率的な確率的勾配更新が可能となり、2つの新しいオンポリシー法—行動ガイドドポリシー勾配(BGPG)と行動ガイドド進化戦略(BGES)—を導入する。これらは、連続的制御環境やだましの報酬環境において、既存手法を上回る性能を発揮する。
We introduce a new approach for comparing reinforcement learning policies, using Wasserstein distances (WDs) in a newly defined latent behavioral space. We show that by utilizing the dual formulation of the WD, we can learn score functions over policy behaviors that can in turn be used to lead policy optimization towards (or away from) (un)desired behaviors. Combined with smoothed WDs, the dual formulation allows us to devise efficient algorithms that take stochastic gradient descent steps through WD regularizers. We incorporate these regularizers into two novel on-policy algorithms, Behavior-Guided Policy Gradient and Behavior-Guided Evolution Strategies, which we demonstrate can outperform existing methods in a variety of challenging environments. We also provide an open source demo.
研究の動機と目的
- 強化学習におけるローカルな行動類似度を超えた、ポリシー類似度の有効な測定と活用の課題に対処すること。
- パrameter や状態訪問頻度ではなく、グローバルな行動軌道に基づいて、柔軟で微分可能なポリシー比較手法の開発。
- 潜在的行動空間におけるウォッサーシュタイン距離と確率的勾配更新を用いた、効率的なポリシー最適化の実現。
- 学習済みテスト関数による行動の反発と吸引信号の統合により、探索性と一般化性能の向上。
- だましの報酬や疎い報酬を伴う挑戦的な環境において、本手法の有効性の実証。
提案手法
- 本稿では、行動埋め込みマップ(BEM)を用いて軌道をコンactな潜在的行動空間にマップする行動ポリシー埋め込み(BPE)を導入し、埋め込みの確率分布を介したポリシー比較を可能にする。
- これらの埋め込み分布間のウォッサーシュタイン距離(WD)を用いてポリシーの不一致度を定義し、これは非一対一のBEMを許容し、KLDなど尤度ベースの発散度の問題を回避する。
- WDの双対定式を用いて、軌道や状態-ポリシー対のスコアを付ける行動テスト関数を導出し、最適化を特定の行動へ向かわせる。
- WDのエントロピー正則化により、ランダム特徴マップを用いた再生核ヒルバート空間(RKHS)表現を通じた、効率的な確率的勾配降下更新が可能になる。
- 2つの新しいオンポリシー法を提案する:行動ガイドドポリシー勾配(BGPG)はKL信頼領域をWDベースの正則化子に置き換え、行動ガイドド進化戦略(BGES)は報酬と行動の新規性を同時に最適化する。
- 本手法はオンポリシーおよびオフポリシー埋め込みをサポートし、オフポリシー版ではプローブ用状態分布を用いてポリシーを独立して評価する。
実験結果
リサーチクエスチョン
- RQ1学習済みの行動埋め込み空間におけるウォッサーシュタイン距離ベースの指標は、KLDのような従来手法に比べ、より効果的かつ解釈可能なポリシー類似度測定を可能にするか?
- RQ2ウォッサーシュタイン距離の双対定式を活用することで、ポリシー最適化を誘導する意味のある行動テスト関数を生成できるか?
- RQ3WDベースの正則化子は、KLベースの信頼領域手法に比べ、より高速かつサンプル効率の良いポリシー最適化を可能にするか?
- RQ4本手法により、だましの報酬環境における探索性が向上し、劣悪なポリシーを避けるために行動の反発信号を用いることができるか?
- RQ5同じフレームワークを、行動スコアリングを通じて模倣学習や安全制約付き強化学習に応用できる範囲はどの程度か?
主な発見
- BGPGは、DeepMind Control SuiteとRoboschoolの6つの連続的制御タスクにおいて、KLDを用いた標準的なTRPOを上回り、より高い最終パフォーマンスを達成し、一貫した向上を示す。
- BGPGは、Zhangらのベースライン手法に比べ、HopperおよびWalkerタスクで約26k秒から約4k秒まで時計時間の短縮を達成し、最良の結果の90%の正規化報酬を3.5倍速く達成する。
- だましの報酬環境では、BGESは障害物を避けながらゴールへ到達する能力を示し、NSR-ESおよびNoisyNet-TRPOは劣悪な局所的報酬のため前進走行を学習できない。
- 四足歩行環境では、BGESが-5000を超える報酬を達成し、壁の周囲を効果的にナビゲートしたのに対し、ベースラインは局所最適解に閉じ込められていた。
- ポイントマス環境では、BGESが-800を超える報酬を達成し、だましの報酬にもかかわらず、効果的な探索とゴール到達を示した。
- 本手法は模倣学習および反発学習へも一般化可能であり、行動テスト関数が特定の行動へ向かわせるポリシーの誘導に使用できることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。