[論文レビュー] Policy Consolidation for Continual Reinforcement Learning
本論文は、連続的強化学習における災難的忘却を軽減するため、複数の時間スケールにわたり、隠れ層ネットワークの段階的構造を用いてエージェントの方策を蒸留する、ポリシー統合(PC)を提案する。この手法は、タスク境界や分布シフトの事前知識を必要とせず、単一タスク、タスクを交互に学習する、およびマルチエージェント自己対戦環境において、継続的学習のパフォーマンスを向上させる。
We propose a method for tackling catastrophic forgetting in deep reinforcement learning that is extit{agnostic} to the timescale of changes in the distribution of experiences, does not require knowledge of task boundaries, and can adapt in extit{continuously} changing environments. In our extit{policy consolidation} model, the policy network interacts with a cascade of hidden networks that simultaneously remember the agent's policy at a range of timescales and regularise the current policy by its own history, thereby improving its ability to learn without forgetting. We find that the model improves continual learning relative to baselines on a number of continuous control tasks in single-task, alternating two-task, and multi-agent competitive self-play settings.
研究の動機と目的
- データ分布が時間とともに連続的に変化する状況下で、深層強化学習における災難的忘却を解消すること。
- タスク境界や事前のタスクセグメンテーションに依存しない手法を開発すること。
- 動的変化が生じる非定常環境(例:進化するダイナミクスを伴う単一タスク学習やマルチエージェント自己対戦)における継続的学習を可能にすること。
- 複数時間スケールの知識蒸留を活用して、ポリシーの保持とパフォーマンスを向上させること。
- 多様なRL設定に適応可能なスケーラブルでタスクに依存しない継続的学習のアプローチを設計すること。
提案手法
- 最近から長期間にわたる、さまざまな時間スケールでのポリシー表現を維持する隠れ層ネットワークの段階的構造を実装する。
- ポリシー・ネットワークと各隠れ層ネットワークとの間で双方向の知識蒸留を実施し、歴史的知識を用いて現在のポリシーを正則化する。
- 訓練の安定化とポリシー更新の制御を図るために、近接ポリシー最適化(PPO)を統合する。
- KLダイバージェンスを用いて、ポリシーと各隠れ層ネットワークの行動分布を一致させる知識蒸留を適用する。
- 大きなポリシー変更をペナルティ化する補助目的関数を用いてポリシー・ネットワークを訓練し、安定性を確保する。
- 異なる時間スケールで動的に隠れ層ネットワークを更新することで、短期的および長期的ポリシー行動を捉える。
実験結果
リサーチクエスチョン
- RQ1データ分布が連続的に変化する状況で、タスク境界が存在しない場合でも、継続的強化学習エージェントは以前に学習したタスクのパフォーマンスを維持できるか?
- RQ2複数時間スケールのポリシー蒸留は、多様なRL環境において災難的忘却をどれほど効果的に低減できるか?
- RQ3タスク境界検出の欠如が、継続的学習のロバスト性と一般化性能に与える影響は何か?
- RQ4自己対戦やタスクの交互学習といった非定常設定において、ポリシー統合(PC)は既存の継続的学習ベースラインと比較してどの程度優れているか?
- RQ5段階的で非離散的な分布シフトを伴う環境において、この手法は効果的に適用可能か?
主な発見
- PCモデルは、評価されたすべての設定(単一タスク、交互に学習する2タスク、マルチエージェント自己対戦)において、継続的学習のパフォーマンスを顕著に向上させる。
- 交互に学習する2タスク環境では、タスク境界の検出がなくても、PCはベースラインを上回り、以前に学習したタスクのパフォーマンスを維持する。
- 環境のダイナミクスが段階的に変化する中でも、複数時間スケールの蒸留によりポリシー更新が安定化され、災難的忘却が低減される。
- 非定常な学習環境において、標準PPOや他の継続的学習ベースラインと比較して、PCはより高い平均報酬を達成する。
- 実験的結果から、隠れ層ネットワークの段階的構造が、時間スケールにわたるポリシー知識の保持を効果的に実現しており、長期的保持性が向上することが示された。
- このアプローチは、データ分布の予測不可能な変化に対してもロバストであり、環境の変化のタイミングや方法についての事前知識を必要としない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。