Skip to main content
QUICK REVIEW

[논문 리뷰] The Primacy Bias in Deep Reinforcement Learning

Evgenii Nikishin, Max Schwarzer|arXiv (Cornell University)|2022. 05. 16.
Reinforcement Learning in Robotics인용 수 14
한 줄 요약

이 논문은 딥 강화 학습에서 초기 경험에 과도하게 기울어지는 '주도성 편향(primacy bias)'을 규명하며, 이는 에이전트가 초기 경험에 과적합되어 후속에 더 나은 데이터를 忽시한다는 것을 의미한다. 연구는 단순하고 일반화 가능한 해결책을 제안한다: 에이전트의 신경망 마지막 레이어를 반복적으로 재설정하면서도 리play 버퍼는 유지함으로써, 최근에 학습한 표현만을 잊도록 한다. 이는 계산 비용 증가 없이도 이산형(Atari 100k) 및 연속 제어(DeepMind Control Suite) 벤치마크에서 일관된 성능 향상을 보여준다.

ABSTRACT

This work identifies a common flaw of deep reinforcement learning (RL) algorithms: a tendency to rely on early interactions and ignore useful evidence encountered later. Because of training on progressively growing datasets, deep RL agents incur a risk of overfitting to earlier experiences, negatively affecting the rest of the learning process. Inspired by cognitive science, we refer to this effect as the primacy bias. Through a series of experiments, we dissect the algorithmic aspects of deep RL that exacerbate this bias. We then propose a simple yet generally-applicable mechanism that tackles the primacy bias by periodically resetting a part of the agent. We apply this mechanism to algorithms in both discrete (Atari 100k) and continuous action (DeepMind Control Suite) domains, consistently improving their performance.

연구 동기 및 목표

  • 딥 강화 학습에서 에이전트가 초기 경험에 과적합되고 후속에 더 나은 데이터를 활용하지 못하는 주도성 편향의 존재를 규명하고, 이를 실증적으로 입증하는 것.
  • 특히 높은 리play 비율과 리play 버퍼가 초기 상호작용을 강화함으로써 이 편향을 악화시키는 방식을 분석하는 것.
  • 에이전트 신경망의 일부를 주기적으로 재설정함으로써 주도성 편향을 완화하는 최소한의 일반적 메커니즘을 제안하는 것.
  • 제안된 리셋 메커니즘이 과적합을 유발할 수 있는 높은 리play 비율과 긴 n-스텝 리턴을 사용한 학습을 가능하게 하여, 이전에는 불안정했을 수 있는 설정에서도 성능 향상을 이끌어내는지 확인하는 것.
  • 다양한 환경과 알고리즘에서의 검증을 통해 이산형 및 연속 제어 환경 모두에서 일관된 성능 향상을 보여주는 것.

제안 방법

  • 에이전트의 신경망 마지막 레이어를 주기적으로 재초기화하면서도 리play 버퍼는 유지함으로써, 최근에 학습한 표현만을 잊는다.
  • 리셋은 학습 중 고정 간격으로 적용되며, 리play 버퍼 내용이나 나머지 네트워크에는 영향을 주지 않는다.
  • 모든 딥 강화 학습 알고리즘과 호환되며, 리셋할 네트워크 레이어와 리셋 주기 두 가지 하이퍼파라미터만 필요하다.
  • 이 메커니즘은 과적합된 초기 데이터에서 회복하여 최근에 더 나은 품질의 경험에서 재학습할 수 있도록 한다.
  • 계산적으로 효율적이며, 표준 학습 루프 외에 추가적인 계산 비용이 들지 않는다.
  • 이 접근법은 인지과학에서 영감을 얻었으며, 초기에 나쁜 해결책을 잊는 것은 장기적 학습에 유리하다.

실험 결과

연구 질문

  • RQ1딥 강화 학습은 초기 경험에 과도하게 기울어지는 주도성 편향을 겪는가? 즉, 초기 경험의 영향이 학습에 지나치게 크고 성능 향상을 저해하는가?
  • RQ2리play 버퍼와 높은 리play 비율 등의 표준 딥 강화 학습 구성요소가 주도성 편향을 어떻게 악화시키는가?
  • RQ3간단하고 일반적인 리셋 메커니즘이 계산 비용 증가 없이 주도성 편향을 완화할 수 있는가?
  • RQ4리셋 메커니즘이 과적합을 유발할 수 있는 높은 리play 비율과 긴 n-스텝 리턴을 사용한 학습을 가능하게 하는가?
  • RQ5리셋 메커니즘은 이산형 및 연속 제어 환경 모두에서 다양한 환경과 알고리즘에서 일관되게 성능 향상을 이끌어낼 수 있는가?

주요 결과

  • 주도성 편향은 딥 강화 학습에 존재한다: 표준 알고리즘으로 학습한 에이전트는 초기 경험에 과적합되어 후속에 더 나은 데이터를 받더라도 성능 향상을 이루지 못한다.
  • 리play 버퍼와 높은 리play 비율은 초기에 발생한 가능성이 떨어지는 데이터를 반복적으로 노출시켜 주도성 편향을 심화시킨다.
  • 제안된 리셋 메커니즘은 여러 알고리즘을 거쳐 Atari 100k 및 DeepMind Control Suite 벤치마크에서 일관된 성능 향상을 이룬다.
  • 이 방법은 기존 에이전트가 과적합을 일으킬 수 있는 높은 리play 비율과 긴 n-스텝 리턴을 사용한 학습을 가능하게 하였다.
  • 추가적인 계산 비용 없이 성능 향상이 달성되어, 이 방법은 매우 실용적이며 광범위하게 적용 가능하다.
  • 결과는 초기에 나쁜 해결책을 잊는 것이 장기적 학습에 유리하다는 점을 시사하며, 이는 인지과학과 인간 학습의 연구 결과와도 부합한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.