Skip to main content
QUICK REVIEW

[논문 리뷰] Return-based Scaling: Yet Another Normalisation Trick for Deep RL

Tom Schaul, Georg Ostrovski|arXiv (Cornell University)|2021. 05. 11.
Reinforcement Learning in Robotics참고 문헌 33인용 수 7
한 줄 요약

이 논문은 복잡한 초모수 조정 없이도 강화학습에서 시간차 오차를 보정하는 데 사용할 수 있는 간단한 정규화 기법인 리턴 기반 스케일링을 제안한다. 이 기법은 보상과 할인 요소로부터 유도된 리턴 통계를 사용해 시간차 오차를 재스케일링하며, 다양한 환경과 학습 단계에서 오차 크기의 불균형을 줄여 학습 안정성과 성능을 향상시킨다. 특히 보상 척도가 다른 여러 작업을 공유 네트워크로 동시에 학습할 경우에 유용하다. 초모수 조정 없이도 성능 향상을 이끌어내며, 적응 조정 없이도 다양한 환경에서 안정적으로 작동한다.

ABSTRACT

Scaling issues are mundane yet irritating for practitioners of reinforcement learning. Error scales vary across domains, tasks, and stages of learning; sometimes by many orders of magnitude. This can be detrimental to learning speed and stability, create interference between learning tasks, and necessitate substantial tuning. We revisit this topic for agents based on temporal-difference learning, sketch out some desiderata and investigate scenarios where simple fixes fall short. The mechanism we propose requires neither tuning, clipping, nor adaptation. We validate its effectiveness and robustness on the suite of Atari games. Our scaling method turns out to be particularly helpful at mitigating interference, when training a shared neural network on multiple targets that differ in reward scale or discounting.

연구 동기 및 목표

  • 다양한 오차 척도로 인해 학습 안정성이 떨어지고 초모수 조정이 지나치게 필요해지는 딥 강화학습의 지속적 문제를 해결하기 위해.
  • 다양한 환경, 작업, 학습 단계에서 강건하게 작동하는 정규화 방법을 개발하기 위해. 특히 서로 다른 보상 척도를 가진 다중 목표를 동시에 학습할 경우에 유의미하다.
  • 초모수, 클리핑, 적응 조정 없이도 작동하며, 기존 알고리즘과 아키텍처와의 호환성을 확보하는 방법을 제안하기 위해.
  • 특히 가치 함수의 리턴 척도가 크게 다를 경우에 다중 목표 학습의 균형을 맞추는 데 효과적인가를 검증하기 위해.

제안 방법

  • 이 방법은 보상 분포와 할인 요소로부터 유도된 리턴의 분산을 기반으로 스케일링 인자를 계산하여 TD 오차를 정규화한다.
  • 공식 $\sigma^2 = \mathbb{V}[R] + \gamma^2 \mathbb{V}[G]$ 를 사용하여, $\mathbb{V}[R]$ 는 보상의 분산이고 $\mathbb{V}[G]$ 는 리턴의 분산이며, 이는 TD 오차의 자연스러운 척도를 추정한다.
  • 이 스케일링 인자를 적용해 TD 오차를 일관되고 최적화에 유리한 범위로 재스케일링함으로써, 높은 크기의 오차가 학습 동역학을 지배하지 않도록 보장한다.
  • 이 방법은 알고리즘에 종속되지 않으며, 에이전트 내부 정보에 접근할 필요 없이 기존 딥 강화학습 파이프라인에 쉽게 통합할 수 있다.
  • 학습자 측의 동역학이 아닌 문제 측의 통계에 기반함으로써, 보상 클리핑, 기울기 클리핑, 적응적 가중치 조정 등의 일반적인 문제들을 피한다.
  • 특히 서로 다른 보상 척도를 가진 다중 헤드나 다중 목표를 동시에 학습할 경우에 효과적이며, 자연스럽게 기여도를 균형 있게 조정한다.

실험 결과

연구 질문

  • RQ1딥 강화학습에서 초모수나 학습 중 적응 조정 없이도 TD 오차를 정규화할 수 있는 방법은 무엇인가?
  • RQ2보상 척도가 크게 다른 환경에 적용했을 때, 기존 정규화 전략(예: 클리핑, 보상 변환)의 주요 실패 원인은 무엇인가?
  • RQ3순수하게 리턴 통계에 기반한 정규화 방법이 다양한 아케이드 게임에서 보상 척도와 에피소드 길이가 다른 환경에서도 학습 안정성과 성능 향상에 기여할 수 있는가?
  • RQ4다양한 오차 크기를 가진 목표를 동시에 학습할 경우 리턴 기반 스케일링은 다중 헤드 학습에 어떤 영향을 미치는가?
  • RQ5공유된 신경망 아키텍처에서 다중 학습 목표 간 간섭을 리턴 기반 스케일링이 얼마나 줄일 수 있는가?

주요 결과

  • 리턴 기반 스케일링은 아케이드 게임 전반에서 TD 오차 크기의 범위를 최대 10개 지수 정도 감소시켜 일관되고 학습 가능한 범위로 만든다.
  • 특히 서로 다른 보상 척도나 할인 요소를 가진 여러 타겟을 공유 네트워크로 동시에 학습할 경우, 학습 안정성과 성능 향상에 뚜렷한 기여를 한다.
  • 아케이드 벤치마크에서 리턴 기반 스케일링은 R2D2 에이전트의 성능 향상에 상당한 기여를 하며, 특히 리턴 분산이 크거나 보상 척도가 극단적인 환경에서 두드러진다.
  • 이 방법은 가치 손실과 보조 손실 구성 요소 간의 균형을 더 잘 맞춰주며, 다중 손실 학습에서 수동적인 계수 조정이 줄어든다.
  • 초기 결과에 따르면, 기대 리턴을 바탕으로 한 가치 편향 초기화와 리턴 기반 스케일링을 조합하면 학습 속도가 향상되어 20억 프레임 이내에 Skiing에서 인간 수준의 성능을 달성할 수 있다.
  • 이 방법은 다양한 학습 단계와 환경에서 강건하며, 최소한의 계산 오버헤드와 추가 초모수 없이도 효과를 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.