[論文レビュー] Off-Policy Actor-Critic with Shared Experience Replay
本稿では、共有の大規模な経験リプレイを用いることで、最先端のデータ効率を達成する、オフポリシーのアクタクリティック強化学習エージェントであるLASERを提案する。オンポリシーの経験とリプレイされた経験を混合し、トラスト領域スキームを採用することで、LASERは強いオフポリシー設定において安定かつ高サンプル効率の学習を可能にし、2億環境ステップで57種類のAtariゲームにおいて448%のヒューマン正規化スコアを達成した。
We investigate the combination of actor-critic reinforcement learning algorithms with uniform large-scale experience replay and propose solutions for two challenges: (a) efficient actor-critic learning with experience replay (b) stability of off-policy learning where agents learn from other agents behaviour. We employ those insights to accelerate hyper-parameter sweeps in which all participating agents run concurrently and share their experience via a common replay module. To this end we analyze the bias-variance tradeoffs in V-trace, a form of importance sampling for actor-critic methods. Based on our analysis, we then argue for mixing experience sampled from replay with on-policy experience, and propose a new trust region scheme that scales effectively to data distributions where V-trace becomes unstable. We provide extensive empirical validation of the proposed solution. We further show the benefits of this setup by demonstrating state-of-the-art data efficiency on Atari among agents trained up until 200M environment frames.
研究の動機と目的
- 経験リプレイを用いたオフポリシーのアクタクリティック学習において、不安定さや収束しない問題を解決すること。
- 複数のエージェントが共通の経験リプレイバッファを共有することで、深層強化学習におけるデータ効率を向上させること。
- V-traceにおけるバイアス・バリアンスのトレードオフを、オフポリシー設定におけるその限界を分析することで克服すること。
- 強いオフポリシー採択下でも政策改善を保証するトラスト領域スキームを開発すること。
- オンポリシー経験とリプレイ経験を混合することが、収束性および性能に不可欠であることを示すこと。
提案手法
- V-traceにおけるバイアスを低減するために、共有リプレイバッファからのオフポリシー経験とオンポリシー経験を組み合わせるハイブリッドトレーニング戦略を提案する。
- 更新を制約することで安定性を維持する政策空間におけるトラスト領域スキームを導入し、政策改善を保証する。
- オフポリシー補正にV-traceと重要度サンプリングを用いるが、オンポリシー混合とトラスト領域制約によってそのバイアスを緩和する。
- 複数のエージェント間で共通のリプレイバッファを実装することで、並列的探索を可能にし、メモリ使用量を削減する。
- 共有環境下でのエージェント固有のメトリクスの衝突を避けるために、優先順位付きリプレイではなく均一リプレイを採用する。
- 共有経験を用いたパopulation-based training (PBT) を実装し、効率的なハイパーパrameterスイープを可能にする。
実験結果
リサーチクエスチョン
- RQ1経験リプレイを用いたオフポリシーのアクタクリティック学習は、オンポリシー経験なしで局所最適な方策に収束可能か?
- RQ2オンポリシーとオフポリシー経験を混合することで、オフポリシーのアクタクリティック手法におけるV-traceの安定性と性能にどのような影響を与えるか?
- RQ3共有経験リプレイは、同時に実行されるハイパーパrameterスイープにおいて、データ効率と学習速度にどのような影響を与えるか?
- RQ4V-traceが不安定化する強いオフポリシー環境下でも、トラスト領域スキームが学習を安定化できるか?
- RQ5マルチエージェントの共有リプレイ環境下では、均一リプレイが優先順位付きリプレイを上回る性能を示すか?
主な発見
- オンポリシー経験とリプレイ経験を混合することで、性能が著しく向上し、収束が保証される。純粋なオフポリシーV-traceは、最適な価値関数を用いても収束しない。
- 共有経験リプレイを用いたLASERは、2億環境ステップで57種類のAtariゲームにおいて448%のヒューマン正規化スコアを達成し、400%を超えるには30億ステップ以上を要する先行手法を上回った。
- 最良のパフォーマンスは、1000万のリプレイバッファと87.5%のリプレイレート(7:1のリプレイ対オンライン比)で達成され、中程度のリプレイ容量で高いデータ効率を実現した。
- 共有経験リプレイにより、10エージェントのスイープでメモリ使用量を10倍削減(1億から1000万に)し、並列的探索と高速なハイパーパrameterスイープを可能にした。
- トラスト領域スキームにより、強いオフポリシー環境下でも安定した学習が可能となり、共有経験を用いても、トラスト領域を用いないベースラインを上回った。
- LASERは100億ステップでDMLab-30において97.2%の中央値ヒューマン正規化パフォーマンスを達成し、強力なマルチタスク一般化能力と効率性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。