[論文レビュー] Redeeming Intrinsic Rewards via Constrained Optimization
本稿では、強化学習における内発的報酬と外発的報酬の動的バランスをとる制約付き最適化フレームワークであるExtrinsic-Intrinsic Policy Optimization (EIPO) を提案する。探索を制約付き最適化問題として定式化することで、不要な場合に内発的報酬を自動で抑制し、報酬が疎である探索フェーズではそれを強化する。61種類のAtariゲームにおいて、手動でのハイパーパrameterチューニングなしで一貫した性能向上を達成した。
State-of-the-art reinforcement learning (RL) algorithms typically use random sampling (e.g., $ε$-greedy) for exploration, but this method fails on hard exploration tasks like Montezuma's Revenge. To address the challenge of exploration, prior works incentivize exploration by rewarding the agent when it visits novel states. Such intrinsic rewards (also called exploration bonus or curiosity) often lead to excellent performance on hard exploration tasks. However, on easy exploration tasks, the agent gets distracted by intrinsic rewards and performs unnecessary exploration even when sufficient task (also called extrinsic) reward is available. Consequently, such an overly curious agent performs worse than an agent trained with only task reward. Such inconsistency in performance across tasks prevents the widespread use of intrinsic rewards with RL algorithms. We propose a principled constrained optimization procedure called Extrinsic-Intrinsic Policy Optimization (EIPO) that automatically tunes the importance of the intrinsic reward: it suppresses the intrinsic reward when exploration is unnecessary and increases it when exploration is required. The results is superior exploration that does not require manual tuning in balancing the intrinsic reward against the task reward. Consistent performance gains across sixty-one ATARI games validate our claim. The code is available at https://github.com/Improbable-AI/eipo.
研究の動機と目的
- 内発的報酬の不一致問題に対処する。これは、難易度の高い探索タスクでは性能を向上させるが、簡単なタスクではエージェントを混乱させることがある。
- 内発的報酬と外発的報酬を組み合わせる際の固定ハイパーパrameter λ に起因する制限を克服する。これは、トレードオフのチューニングが不適切であるために、しばしば性能が最適でない結果をもたらす。
- 内発的報酬の影響をエージェントの現在の探索ニーズに基づいて自動的に調整する、原理的で整合性のある手法を開発する。
- 方策最適化が内発的報酬信号によるバイアスを避けるように、真の外発的報酬の目的と整合したまま保つこと。
提案手法
- 外発的報酬を最大化する制約付き最適化問題として強化学習の目的関数を定式化し、内発的報酬の蓄積に制約を課す。
- ラグランジュ緩和を用いて双対最適化問題を導出し、方策とラグランジュ乗数を同時に更新することで、内発的報酬の影響を動的に制御する。
- RND や ICM などの既存の内発的報酬関数と統合可能であり、特定の内発的報酬メカニズムに依存しない。
- PPO などのポリシー勾配フレームワーク内に適用することで、外発的報酬と制約付き内発的報酬の両方をエンドツーエンドで学習可能にする。
- 訓練中に内発的報酬の重要性を動的に調整する:外発的報酬の進捗が十分な場合は抑制し、新しい状態の発見が必要な場合は増幅する。
- 制約のしきい値に1つのハイパーパrameter (α) と、ラグランジュ乗数の更新に1つのハイパーパrameter (β) を使用し、環境ごとに一度だけチューニングし、複数の実験で再利用する。
実験結果
リサーチクエスチョン
- RQ1制約付き最適化フレームワークは、手動でのハイパーパrameterチューニングなしで、強化学習における内発的報酬と外発的報酬のバランスを自動でとることができるか?
- RQ2EIPOは、探索の難易度が異なる多様なAtari環境において、標準的な内発的報酬手法や外発的報酬のみのベースラインを上回る性能を示すか?
- RQ3内発的報酬と外発的報酬が不一致する状況、例えば誤った新奇性信号を持つ環境では、EIPOはどのように性能を発揮するか?
- RQ4内発的報酬があまり重要でない密度の高い報酬環境(例:MuJoCo)においても、EIPOは強力な性能を維持できるか?
- RQ5EIPOの性能向上は、RND と ICM といった異なる内発的報酬メカニズムに対しても、ロバストであるか?
主な発見
- EIPO-RND は、外発的報酬のみのPPOやノイズあり探索のPPOを含むすべてのベースラインを、61種類のAtariゲームで上回り、すべてのベースラインに対して優位性を示す確率が 0.5 を超えた。
- モンテズマのレインボウのような報酬が疎であるため探索が重要となるゲームでは、外発的報酬のみの方法よりもEIPOがはるかに高い最終スコアを達成した。
- ジェームズ・ボンドのような簡単な探索タスクでは、標準的な内発的報酬手法が不要な探索を引き起こすのをEIPOが抑制することで、性能の低下を回避した。
- ICM が誤った内発的報酬を生成する環境(例:Kaboom)においても、EIPO-ICM はPPOとの性能差を埋めることができ、報酬の不一致に対してもロバストであることを示した。
- 密度の高い報酬を持つMuJoCo環境では、EIPOはPPO や RND の性能を模倣または上回り、簡単な環境でも性能が低下しないことを確認した。
- 環境ごとのハイパーパrameter再チューニングなしで一貫した向上を達成したため、本手法の適応性とタスク間一般化能力が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。