Skip to main content
QUICK REVIEW

[논문 리뷰] The Dormant Neuron Phenomenon in Deep Reinforcement Learning

Ghada Sokar, Rishabh Agarwal|arXiv (Cornell University)|2023. 02. 24.
Neural dynamics and brain function인용 수 7
한 줄 요약

이 논문은 딥 강화학습에서 학습 과정 중에 활성화가 정지되는 '잠자는 신경망 현상'을 규명한다. 이 현상은 네트워크의 표현력을 떨어뜨린다. 저자들은 ReDo라는 방법을 제안한다. 이 방법은 주기적으로 잠자리에 있는 신경망의 가중치를 다시 초기화하여 재활성화함으로써 네트워크 용량을 유지하고, 다양한 강화학습 알고리즘과 환경에서 샘플 효율성과 성능을 향상시킨다.

ABSTRACT

In this work we identify the dormant neuron phenomenon in deep reinforcement learning, where an agent's network suffers from an increasing number of inactive neurons, thereby affecting network expressivity. We demonstrate the presence of this phenomenon across a variety of algorithms and environments, and highlight its effect on learning. To address this issue, we propose a simple and effective method (ReDo) that Recycles Dormant neurons throughout training. Our experiments demonstrate that ReDo maintains the expressive power of networks by reducing the number of dormant neurons and results in improved performance.

연구 동기 및 목표

  • 과도하게 파rameter화되어 있음에도 불구하고 딥 RL 에이전트가 네트워크 표현력을 상실하는 이유를 규명하는 것.
  • 특히 비활성화된 신경망의 출현으로 인한 딥 RL에서의 학습 성능 저하의 근본 원인을 규명하는 것.
  • 학습 중 네트워크 용량을 유지하기 위한 경량이며 비파괴적인 방법을 개발하는 것.
  • catastrophic forgetting 없이 샘플 효율성과 최종 성능을 향상시키는 것.
  • 다양한 RL 알고리즘과 환경에서 잠자는 신경망 현상이 얼마나 일반적인지 입증하는 것.

제안 방법

  • 저자들은 일정한 입력 배치에서 활성화가 임계값 이하인 신경망을 잠자는 신경망으로 정의한다 (예: 1e-4).
  • 그들은 ReDo를 도입하여 주기적으로 잠자리에 있는 신경망의 가중치를 작은 무작위 초기화로 재설정함으로써 재활성화한다.
  • ReDo는 학습 중 고정 간격으로 적용되며, 네트워크의 나머지 부분이나 학습 과정을 수정하지 않는다.
  • 이 방법은 미니배치를 기반으로 한 활성화 통계를 바탕으로 잠자는 신경망을 식별하기 위해 하이퍼파라미터 임계값을 사용한다.
  • ReDo는 표준 RL 알고리즘과 호환되며, 아키텍처 변경 없이도 적용 가능하다.
  • 모든 이전에 학습된 가중치를 유지함으로써 재난적 기억 상실을 방지하며, 오직 비활성화된 신경망만 수정한다.
Figure 1: Sample efficiency curves for DQN, with a replay ratio of 1, when using network resets (Nikishin et al., 2022 ) , weight decay (WD), and our proposed ReDo . Shaded regions show 95% CIs. The figure shows interquartile mean (IQM) human-normalized scores over the course of training, aggregated
Figure 1: Sample efficiency curves for DQN, with a replay ratio of 1, when using network resets (Nikishin et al., 2022 ) , weight decay (WD), and our proposed ReDo . Shaded regions show 95% CIs. The figure shows interquartile mean (IQM) human-normalized scores over the course of training, aggregated

실험 결과

연구 질문

  • RQ1왜 과도하게 파rameter화되어 있음에도 불구하고 딥 RL 에이전트가 네트워크 표현력을 상실하는가?
  • RQ2학습 과정 중에 잠자는 신경망의 수가 얼마나 증가하는가? 이는 알고리즘과 환경에 따라 어떻게 달라지는가?
  • RQ3잠자는 신경망을 재활성화하면 딥 RL에서 학습 성능과 샘플 효율성이 향상되는가?
  • RQ4성능와 안정성 측면에서 ReDo는 전체 네트워크 가중치 초기화나 다른 정규화 기법보다 어떻게 비교되는가?
  • RQ5잠자는 신경망 현상은 액터-크리틱 방법과 연속 제어 환경에서도 발생하는가?

주요 결과

  • DQN, DrQ, SAC 에이전트 모두에서 학습 시간이 지남에 따라 잠자는 신경망의 수가 크게 증가한다. 특히 기울기 업데이트 빈도가 높을수록 더욱 두드러진다.
  • 감독 학습에서는 이 현상이 관찰되지 않아, RL 학습에서만 특유의 동역학이 존재함을 시사한다.
  • ReDo는 학습 중 잠자는 신경망 수를 최대 50%까지 감소시켜 더 높은 네트워크 표현력을 유지한다.
  • 17개의 Atari 게임에서 DQN에 ReDo를 적용한 결과, 네트워크 초기화 및 가중치 감소 기법을 포함한 모든 방법보다 높은 성능를 기록한다.
  • ReDo는 샘플 효율성을 향상시키며, 이산 및 연속 제어 과제 모두에서 인간 기준 IQM 점수에서 기준 모델을 일관되게 초월한다.
  • 이 방법은 다양한 알고리즘과 환경에서 효과적이며, 아키텍처나 하이퍼파라미터 재설정 없이도 넓은 적용 가능성을 보여준다.
Figure 2: The percentage of dormant neurons increases throughout training for DQN agents.
Figure 2: The percentage of dormant neurons increases throughout training for DQN agents.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.