[論文レビュー] Transient Non-Stationarity and Generalisation in Deep Reinforcement Learning
この論文は、深層強化学習における一時的な非定常性—進化する行動方策によって引き起こされるもの—が、定常環境であっても一般化性能を著しく低下させることを特定した。これを是正するために、繰り返し再学習(Iter)を提案する。この手法は、訓練中に非定常性を軽減するため、定期的にポリシーを新規に初期化された学生ネットワークに蒸留する。このアプローチにより、ProcGenおよびMultiroomベンチマークにおける一般化性能が顕著に向上した。
Non-stationarity can arise in Reinforcement Learning (RL) even in stationary environments. For example, most RL algorithms collect new data throughout training, using a non-stationary behaviour policy. Due to the transience of this non-stationarity, it is often not explicitly addressed in deep RL and a single neural network is continually updated. However, we find evidence that neural networks exhibit a memory effect where these transient non-stationarities can permanently impact the latent representation and adversely affect generalisation performance. Consequently, to improve generalisation of deep RL agents, we propose Iterated Relearning (ITER). ITER augments standard RL training by repeated knowledge transfer of the current policy into a freshly initialised network, which thereby experiences less non-stationarity during training. Experimentally, we show that ITER improves performance on the challenging generalisation benchmarks ProcGen and Multiroom.
研究の動機と目的
- 定常環境であっても、変化する行動方策によって引き起こされる一時的な非定常性が、一般化性能に与える影響を調査すること。
- 性能低下の原因が、完全に自己消失する記憶効果(catastrophic forgetting)であるという仮定に疑問を呈し、学習済み表現における記憶効果を提案すること。
- 非定常性を訓練中に低減する実用的な訓練パラダイムを構築することにより、深層強化学習エージェントの一般化性能を向上させること。
- 非定常性が一般化性能に悪影響を及えること、およびネットワークの定期的再初期化がこの影響を緩和できることを実験的に検証すること。
提案手法
- 現在のポリシーおよび価値関数を定期的に新しい初期化済み学生ネットワークに蒸留する訓練パラダイム「繰り返し再学習(Iter)」を提案する。
- 知識蒸留を用いて、訓練済みの「教師」ネットワークから「学生」ネットワークへポリシーおよび価値出力を移管し、学生の訓練段階における非定常性を最小限に抑える。
- 主な訓練と並行して蒸留を実行することで、追加のデータを必要とせず、非定常性の増加も最小限に抑えられる。
- 学生の学習をガイドするため、教師ネットワークからのソフトラベルを用い、改善された潜在表現の学習を促進する。
- 各訓練イテレーションにおいて、学生が蒸留を終了すると、教師に置き換えられるという繰り返しのプロセスを採用し、定常なデータ分布上で継続的な再訓練を可能にする。
- Multiroom環境およびProcGenベンチマークでアプローチを検証し、ホールドアウトされたテスト環境における一般化性能を比較する。
実験結果
リサーチクエスチョン
- RQ1変化する行動方策によって引き起こされる深層RLにおける一時的な非定常性が、定常環境であっても一般化性能を低下させるか?
- RQ2深層ニューラルネットワークは、非定常な訓練中に学習した非最適または劣悪な特徴をどの程度保持し、未観測の入力に対する性能に悪影響を及えるか?
- RQ3知識蒸留を用いたポリシーネットワークの定期的再初期化が、深層RLエージェントの一般化性能を向上させられるか?
- RQ4繰り返し再学習は、標準的な訓練法および他の正則化技術と比較して、困難なベンチマークにおける一般化性能でどの程度優れているか?
- RQ5非定常な訓練中に学習された特徴の関連性が、一般化性能の低下に果たす役割は何か?
主な発見
- CIFAR-10における教師付き学習において、一時的な非定常性が、訓練精度がほぼ変化しないままでも、テスト精度の著しい低下を引き起こす。
- ニューラルネットワークは、非定常な訓練中に学習した関連性はあるが非最適な特徴を記憶し、忘れられない記憶効果を示す。
- 表現行列の特異値分解により、関連性はあるが非最適なデータで訓練されたネットワークがより多くの特徴に依存していることが示され、レガシーフィーチャ仮説を支持する。
- 繰り返し再学習は、ProcGenベンチマークにおける一般化性能を向上させ、ホールドアウトされたテスト環境で標準的な訓練法よりも優れたパフォーランスを示した。
- 繰り返し再学習はMultiroom環境でも性能向上を示し、多様で困難な強化学習ベンチマークにおいて有効であることを示した。
- この手法は、既存の正則化技術と相補的である。なぜなら、正則化だけでは完全に解消できない非定常性に起因する一般化失敗の根本原因に直接的に対処しているからである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。