Skip to main content
QUICK REVIEW

[논문 리뷰] Learning functions across many orders of magnitudes.

Hado van Hasselt, Arthur Guez|arXiv (Cornell University)|2016. 02. 24.
Evolutionary Algorithms and Applications인용 수 11
한 줄 요약

이 논문은 다양한 크기의 함수를 학습하기 위한 적응형 정규화 방법을 제안하며, 도메인 특화 보상 클리핑이 필요 없이 척도 불변 훈련을 가능하게 한다. 이 방법은 정규화 업데이트 동안 비정규화된 출력을 유지함으로써 학습을 안정화시키고, 딥 강화 학습에서 특히 Ms. Pac-Man 및 Centipede에서 히وري스틱 보상 클리핑 없이 이전 방법들을 능가하는 성능을 보인다.

ABSTRACT

Learning non-linear functions can be hard when the magnitude of the target function is unknown beforehand, as most learning algorithms are not scale invariant. We propose an algorithm to adaptively normalize these targets. This is complementary to recent advances in input normalization. Importantly, the proposed method preserves the unnormalized outputs whenever the normalization is updated to avoid instability caused by non-stationarity. It can be combined with any learning algorithm and any non-linear function approximation, including the important special case of deep learning. We empirically validate the method in supervised learning and reinforcement learning and apply it to learning how to play Atari 2600 games. Previous work on applying deep learning to this domain relied on clipping the rewards to make learning in different games more homogeneous, but this uses the domain-specific knowledge that in these games counting rewards is often almost as informative as summing these. Using our adaptive normalization we can remove this heuristic without diminishing overall performance, and even improve performance on some games, such as Ms. Pac-Man and Centipede, on which previous methods did not perform well.

연구 동기 및 목표

  • 목표 크기가 과제 간에 크게 다를 때 비선형 함수를 학습하는 데 도전하는 것.
  • 스케일을 사전에 알 수 없더라도 안정성을 해치지 않으면서도 알려지지 않은 목표 스케일에 적응할 수 있는 정규화 방법을 개발하는 것.
  • 딥 러닝을 포함한 어떤 학습 알고리즘과 비선형 함수 근사기와도 호환 가능하게 하는 것.
  • 특히 아케이드 2600 게임에서 히وري스틱 보상 클리핑이 필요 없도록 하는 것.

제안 방법

  • 훈련 중에 목표 함수의 크기 변화를 처리하기 위해 적응형으로 정규화를 수행하는 방법.
  • 정규화 업데이트가 비정규화된 출력을 유지하도록 설계되어 비정상성과 훈련의 불안정성을 방지한다.
  • 기본 학습 알고리즘과 함수 근사기와의 관계 없이 무관하게 작동하므로 딥 러닝 모델과 통합 가능하다.
  • 정규화를 동적으로 조정하기 위해 목표 통계(예: 평균과 척도)의 누적 추정치를 유지한다.
  • 정규화는 훈련 중에 적용되지만 최종 비정규화 예측에는 영향을 주지 않아 일관성을 유지한다.
  • 지도 학습과 강화 학습 모두에 호환되며, 희소 보상 신호가 있는 환경에도 적용 가능하다.

실험 결과

연구 질문

  • RQ1목표 함수의 크기가 여러 온스 오더에 걸쳐 퍼져 있을 때 적응형 정규화가 학습 안정성과 성능을 향상시키는가?
  • RQ2아케이드 2600 게임에서 히وري스틱 보상 클리핑을 제거하면 성능이 떨어지는가, 아니면 적응형 정규화가 성능을 유지하거나 향상시킬 수 있는가?
  • RQ3딥 강화 학습에서 고정 또는 도메인 특화 정규화 전략과 비교해 제안된 정규화 방법은 어떻게 성능을 내는가?
  • RQ4이 방법은 다양한 학습 과제와 함수 근사 아키텍처에 얼마나 일반화되는가?
  • RQ5비정상성 문제를 피하기 위해 정규화 업데이트 중 비정규화 출력을 유지할 수 있는가?

주요 결과

  • 제안된 방법은 이전 딥 러닝 방법이 어려움을 겪었던 아케이드 2600 게임인 Ms. Pac-Man과 Centipede에서 성능을 향상시킨다.
  • 이전에 훈련 안정화를 위해 필수였던 보상 클리핑 없이도 성능이 유지되거나 향상된다.
  • 스케일에 대한 사전 지식이 없이도 다양한 크기의 목표 함수에 대해 안정적인 학습이 가능하다.
  • 적응형 정규화는 지도 학습과 강화 학습 모두에서 효과적이다.
  • 정규화 업데이트 중 비정규화 출력을 유지함으로써 비정상성으로 인한 불안정성 문제를 방지한다.
  • 어떤 학습 알고리즘과 비선형 함수 근사기(딥 네ural 네트워크 포함)와도 호환된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.