Skip to main content
QUICK REVIEW

[論文レビュー] The Impact of Non-stationarity on Generalisation in Deep Reinforcement Learning

Maximilian Igl, Gregory Farquhar|arXiv (Cornell University)|Jun 10, 2020
Reinforcement Learning in Robotics参考文献 28被引用数 15
ひとこと要約

この論文は、進化する方策と変化する学習ターゲットによって引き起こされる非定常性が、一般化性能を損なう主要因であると特定する。非定常性を軽減し、ProcGenおよびMultiroomベンチマークでの性能を向上させるために、反復的再学習(ITER)を提案する。ITERは、訓練済み方策の知識を繰り返し新たに初期化されたネットワークに転送する。

ABSTRACT

Non-stationarity arises in Reinforcement Learning (RL) even in stationary environments. Most RL algorithms collect new data throughout training, using a non-stationary behaviour policy. Furthermore, training targets in RL can change even with a fixed state distribution when the policy, critic, or bootstrap values are updated. We study these types of non-stationarity in supervised learning settings as well as in RL, finding that they can lead to worse generalisation performance when using deep neural network function approximators. Consequently, to improve generalisation of deep RL agents, we propose Iterated Relearning (ITER). ITER augments standard RL training by repeated knowledge transfer of the current policy into a freshly initialised network, which thereby experiences less non-stationarity during training. Experimentally, we show that ITER improves performance on the challenging generalisation benchmarks ProcGen and Multiroom.

研究の動機と目的

  • 関数近似を用いた深層強化学習における、方策と学習ターゲットの非定常性が一般化性能に与える悪影響を調査すること。
  • 深層ネットワークを用いた教師あり学習および強化学習の両設定において、非定常性の影響を分析すること。
  • 方策学習中に非定常性を低減する訓練手法を開発し、一般化性能を向上させること。
  • ProcGenやMultiroomのような困難なベンチマークにおける一般化性能の向上を実証的に検証すること。

提案手法

  • ITERは、訓練済み方策の知識を繰り返し新たに初期化されたニューラルネットワークに転送することで、学習中の非定常性を低減する。
  • この手法は、定期的な間隔で、訓練済みネットワークの方策行動を、新たに初期化されたランダムな初期化を持つネットワークに知識蒸留する。
  • 学習はサイクルを繰り返す:方策が訓練され、その知識が新しいネットワークに転送され、その後、新規に初期化されたネットワークから再び微調整される。
  • このプロセスにより、学習プロセスにおける非定常なターゲットおよび方策行動の影響が段階的に低減される。
  • 標準的な強化学習の学習目的を維持しつつ、周期的な再初期化と知識転送を導入することで、学習ダイナミクスの安定化を図る。
  • 実験では、価値ベースおよび方策ベースの強化学習アルゴリズムの両方へこの手法を適用した。

実験結果

リサーチクエスチョン

  • RQ1関数近似を用いた深層強化学習において、方策と学習ターゲットの非定常性が一般化に与える影響は何か?
  • RQ2新たに初期化されたネットワークへの知識蒸留は、学習中に非定常性をどの程度低減するか?
  • RQ3反復的再訓練は、ProcGen や Multiroom のような困難で多様な強化学習ベンチマークにおける一般化を向上させ得るか?
  • RQ4サンプル効率および分布シフトに対する耐性という観点から、ITER は標準的な訓練法と比べてどのように異なるか?
  • RQ5非定常性の低減は、多様な環境にわたるより安定的で一般化可能な方策をもたらすか?

主な発見

  • 方策と学習ターゲットの非定常性は、定常環境であっても、深層強化学習における一般化性能を顕著に低下させる。
  • ProcGenベンチマークでは、ITERが標準的な訓練法と比較して、平均スコアおよび中央値スコアの両方を向上させる。
  • Multiroom環境では、未学習のテストレベルにおいてもITERが優れた一般化性能を示し、より高い耐性を示している。
  • 非定常なターゲットおよび方策行動の悪影響が低減され、より安定した学習ダイナミクスが得られる。
  • 新たに初期化されたネットワークへの知識転送は、学習中の非定常性の影響を効果的に緩和する。
  • ITERは、下位の強化学習アルゴリズムやハイパーパrameterを変更することなく、複数の環境で一貫した改善を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。