Skip to main content
QUICK REVIEW

[論文レビュー] The Dormant Neuron Phenomenon in Deep Reinforcement Learning

Ghada Sokar, Rishabh Agarwal|arXiv (Cornell University)|Feb 24, 2023
Neural dynamics and brain function被引用数 7
ひとこと要約

この論文は、深層強化学習における'不活性化ニューロン現象'を特定し、訓練中にニューロンが不活性化することでネットワーク表現力が低下することを明らかにした。著者らは、不活性化されたニューロンの重みを定期的にリセットすることで再活性化するReDoという手法を提案した。この手法により、ネットワーク容量が維持され、複数のRLアルゴリズムおよび環境で、サンプル効率性と性能が向上する。

ABSTRACT

In this work we identify the dormant neuron phenomenon in deep reinforcement learning, where an agent's network suffers from an increasing number of inactive neurons, thereby affecting network expressivity. We demonstrate the presence of this phenomenon across a variety of algorithms and environments, and highlight its effect on learning. To address this issue, we propose a simple and effective method (ReDo) that Recycles Dormant neurons throughout training. Our experiments demonstrate that ReDo maintains the expressive power of networks by reducing the number of dormant neurons and results in improved performance.

研究の動機と目的

  • 過パラメータ化されているにもかかわらず、深層RLエージェントがネットワーク表現力を失う理由を調査すること。
  • 特に不活性なニューロンの出現に起因する、深層RLにおける学習性能の低下の根本的要因を同定すること。
  • 訓練中にネットワーク容量を維持するための軽量で、干渉のない手法を開発すること。
  • 深刻な忘却を引き起こさずに、サンプル効率性と最終的な性能を向上させること。
  • 不活性化ニューロン現象が多様なRLアルゴリズムおよび環境にわたり一般に見られるかどうかを示すこと。

提案手法

  • 著者らは、バッチ入力全体で活性化値がしきい値(例:1e-4)未満であるニューロンを不活性化ニューロンと定義する。
  • 彼らは、不活性化されたニューロンの重みを小さなランダム初期化に定期的にリセットすることで再活性化するReDoという手法を導入する。
  • ReDoは、訓練中における固定間隔に応じて適用され、ネットワークの他の部分や学習プロセスを変更しない。
  • この手法は、ミニバッチ全体を通じた活性化統計に基づいて、不活性化ニューロンを特定するためのハイパーパrameterしきい値を用いる。
  • ReDoは、標準的なRLアルゴリズムと互換性があり、アーキテクチャの変更を必要としない。
  • すべての事前学習済み重みを保持するため、深刻な忘却を回避する。
Figure 1: Sample efficiency curves for DQN, with a replay ratio of 1, when using network resets (Nikishin et al., 2022 ) , weight decay (WD), and our proposed ReDo . Shaded regions show 95% CIs. The figure shows interquartile mean (IQM) human-normalized scores over the course of training, aggregated
Figure 1: Sample efficiency curves for DQN, with a replay ratio of 1, when using network resets (Nikishin et al., 2022 ) , weight decay (WD), and our proposed ReDo . Shaded regions show 95% CIs. The figure shows interquartile mean (IQM) human-normalized scores over the course of training, aggregated

実験結果

リサーチクエスチョン

  • RQ1過パラメータ化されているにもかかわらず、なぜ深層RLエージェントがネットワーク表現力を失うのか?
  • RQ2訓練時間とともに不活性化ニューロンの数がどの程度増加するか、および異なるアルゴリズムや環境でどのように変化するか?
  • RQ3不活性化されたニューロンを再活性化することで、深層RLにおける学習性能とサンプル効率性が向上するか?
  • RQ4ReDoは、ネットワーク全体の重みリセットや他の正則化手法と比較して、性能と安定性においてどのように異なるか?
  • RQ5アクタクリティック手法や連続的制御環境においても、不活性化ニューロン現象は同様に発生するか?

主な発見

  • DQN、DrQ、SACエージェントにおいて、訓練時間とともに不活性化ニューロンの数が顕著に増加し、勾配更新頻度が高いほど顕著である。
  • 教師あり学習では不活性化ニューロン現象が見られないため、RL訓練における特異的なダイナミクスであることが示唆される。
  • ReDoは訓練中、不活性化ニューロンの数を最大50%まで削減し、より高いネットワーク表現力を維持する。
  • 17種類のAtariゲームにおいて、DQNにReDoを適用した結果、ネットワークリセットや重み減衰を含むすべての手法よりも高い性能を達成した。
  • ReDoはサンプル効率性を向上させ、離散的および連続的制御タスクの両方で、人間基準IQMスコアが一貫してベースラインを上回った。
  • この手法は複数のアルゴリズムおよび環境で有効であり、アーキテクチャやハイパーパrameterの再設計を要せず、広範な適用可能性を示した。
Figure 2: The percentage of dormant neurons increases throughout training for DQN agents.
Figure 2: The percentage of dormant neurons increases throughout training for DQN agents.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。