Skip to main content
QUICK REVIEW

[논문 리뷰] Resetting the Optimizer in Deep RL: An Empirical Study

Kavosh Asadi, Rasool Fakoor|arXiv (Cornell University)|2023. 06. 30.
Diffusion and Search DynamicsBiochemistry, Genetics and Molecular Biology인용 수 3
한 줄 요약

이 논문은 딥 강화 학습에서 각 학습 반복의 시작 시 내부 최적화기 상태(예: 모멘텀 및 분산 추정치)를 재설정하는 방법을 제안한다. 레인보우 알고리즘 내의 최적화기(예: Adam)에 이 간단한 수정을 적용함으로써 저자들은 아타리 벤치마크에서 뚜렷한 성능 향상을 보여주며, 오염된 모멘텀 추정치를 피할 경우 더 안정적이고 효과적인 학습이 가능하다고 밝힌다.

ABSTRACT

We focus on the task of approximating the optimal value function in deep reinforcement learning. This iterative process is comprised of solving a sequence of optimization problems where the loss function changes per iteration. The common approach to solving this sequence of problems is to employ modern variants of the stochastic gradient descent algorithm such as Adam. These optimizers maintain their own internal parameters such as estimates of the first-order and the second-order moments of the gradient, and update them over time. Therefore, information obtained in previous iterations is used to solve the optimization problem in the current iteration. We demonstrate that this can contaminate the moment estimates because the optimization landscape can change arbitrarily from one iteration to the next one. To hedge against this negative effect, a simple idea is to reset the internal parameters of the optimizer when starting a new iteration. We empirically investigate this resetting idea by employing various optimizers in conjunction with the Rainbow algorithm. We demonstrate that this simple modification significantly improves the performance of deep RL on the Atari benchmark.

연구 동기 및 목표

  • 학습 반복 간 최적화 경로의 변화로 인해 발생하는 내부 최적화기 상태 추정치 오염 문제를 해결하기 위함.
  • 각 학습 반복의 시작 시 내부 최적화기 파라미터(예: 일阶 및 이阶 모멘텀)를 재설정함으로써 학습 안정성과 성능 향상 여부를 조사하기 위함.
  • 특히 레인보우 알고리즘을 활용한 아타리 벤치마크 환경에서 다양한 최적화기와 환경 간에 이 재설정 메커니즘이 얼마나 효과적인지 평가하기 위함.
  • 최적화기에서 장기 기억을 제거함으로써 변화하는 손실 경로로 인한 부정적 간섭을 완화한다는 경험적 증거를 제공하기 위함.

제안 방법

  • 각 학습 반복의 시작 시, 내부 최적화기 상태(예: 기울기 평균 및 분산의 누적 추정치)가 초기 값으로 재설정되고 나서 정책 네트워크가 갱신된다.
  • 이 방법은 네트워크 아키텍처나 학습률 스케줄링을 변경하지 않고도 표준 적응형 최적화기(예: Adam, RMSProp, AdamW)에 적용된다.
  • 재설정은 현재 경험 전이 배치의 기울기를 계산하기 이전인 각 반복의 시작 시점에 수행된다.
  • 이 방법은 표준 딥 Q-네트워크 기반 에이전트인 레인보우 알고리즘에 통합되어 아타리-57 벤치마크 세트에서의 성능을 평가한다.
  • 직접 성능 및 학습 다이내믹스를 비교할 수 있도록, 최적화기 재설정 유무에 따라 학습을 수행한다.
  • 다양한 랜덤 시드와 환경에서 샘플 효율성과 최종 성능을 평가한다.

실험 결과

연구 질문

  • RQ1각 학습 반복의 시작 시 최적화기 내부 상태를 재설정하면 딥 강화 학습에서 학습 성능 향상이 이루어지는가?
  • RQ2내부 상태를 반복 간에 재설정할 경우, 다양한 적응형 최적화기(예: Adam, RMSProp)의 성능은 어떻게 변화하는가?
  • RQ3최적화기 재설정이 변화하는 최적화 경로로 인한 부정적 영향을 학습 안정성에 얼마나 줄일 수 있는가?
  • RQ4이 간단한 수정이 아키텍처 변경 없이 다양한 아타리 환경에서 일관된 향상을 이끌 수 있는가?
  • RQ5성능 향상의 원인은 더 나은 일반화, 더 빠른 수렴, 아니면 학습 다이내믹스의 분산 감소 때문인가?

주요 결과

  • 각 학습 반복의 시작 시 최적화기 내부 파라미터를 재설정하면 아타리-57 벤치마크 전반에서 일관되고 뚜렷한 성능 향상이 이루어진다.
  • 상태-액션 공간 복잡도가 높고 비정적 동역학을 보이는 환경에서 성능 향상이 가장 두드러지며, 이는 최적화기 상태 오염이 가장 해로울 가능성이 높기 때문이다.
  • 이 방법은 샘플 효율성을 향상시키며, 표준 Adam보다 적은 학습 스텝 수로 더 높은 인간 정규화 점수를 달성하는 에이전트를 가능하게 한다.
  • 다양한 랜덤 시드에 걸쳐 성능 향상이 안정적으로 관찰되며, 재설정 주기의 하이퍼파라미터 튜닝에 민감하지 않다.
  • Adam, AdamW, RMSProp 등 여러 최적화기에서 성능 향상이 관찰되어, 이 효과가 특정 최적화기로 국한되지 않고 일반화됨을 시사한다.
  • 저자들은 이 방법이 레인보우 알고리즘과 결합될 경우 몇몇 아타리 환경에서 최신 기술 수준 성능을 달성하며, 재설정되지 않은 최적화기를 사용한 표준 학습보다 뛰어난 성능을 보인다고 보고한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.