Skip to main content
QUICK REVIEW

[논문 리뷰] CrossNorm: Normalization for Off-Policy TD Reinforcement Learning

Aditya Bhatt, Max Argus|arXiv (Cornell University)|2019. 02. 14.
Fuel Cells and Related Materials참고 문헌 28인용 수 18
한 줄 요약

이 논문은 DDPG와 TD3에서 최적화 안정성을 향상시키기 위해 온-정책 및 오프-정책 전이를 조합하는 새로운 정규화 기법인 CrossNorm을 소개한다. 두 개의 서로 다른 데이터 분포에 걸쳐 특징을 재중앙화함으로써, 훈련 안정성을 향상시키며 타겟 네트워크가 필요 없게 되고, MuJoCo 벤치마크에서 최신 기법들을 능가한다.

ABSTRACT

Off-policy temporal difference (TD) methods are a powerful class of reinforcement learning (RL) algorithms. Intriguingly, deep off-policy TD algorithms are not commonly used in combination with feature normalization techniques, despite positive effects of normalization in other domains. We show that naive application of existing normalization techniques is indeed not effective, but that well-designed normalization improves optimization stability and removes the necessity of target networks. In particular, we introduce a normalization based on a mixture of on- and off-policy transitions, which we call cross-normalization. It can be regarded as an extension of batch normalization that re-centers data for two different distributions, as present in off-policy learning. Applied to DDPG and TD3, cross-normalization improves over the state of the art across a range of MuJoCo benchmark tasks.

연구 동기 및 목표

  • 깊이 있는 오프-정책 TD 알고리즘에서 효과적인 특징 정규화의 부족을 해결하기 위해.
  • 표준 정규화 기법이 오프-정책 강화 학습 환경에서 실패하는 이유를 조사하기 위해.
  • 온-정책 및 오프-정책 전이 간의 분포 이탈을 효과적으로 처리할 수 있는 새로운 정규화 체계를 설계하기 위해.
  • DDPG 및 TD3와 같은 오프-정책 딥 강화 학습 알고리즘에서 훈련 안정성과 성능을 향상시키기 위해.
  • 하이브리드 정규화 전략을 활용해 타겟 네트워크의 필요성을 제거하기 위해.

제안 방법

  • CrossNorm은 온-정책 및 오프-정책 전이의 혼합에 기반해 특징 분포를 안정화시키는 정규화 레이어를 도입한다.
  • 오프-정책 학습에서 존재하는 두 개의 서로 다른 데이터 분포에 기반해 통계를 이용해 특징을 재중앙화함으로써 배치 정규화를 확장한다.
  • 온-정책 및 오프-정책 전이에 대해 별도로 배치 통계를 계산하고, 이를 가중 조합하여 입력 특징을 정규화한다.
  • CrossNorm은 DDPG와 TD3의 정책 네트워크 및 Q-네트워크에 통합되어 표준 배치 정규화 레이어를 대체한다.
  • 비선형 활성화 함수 이전에 정규화를 적용하여 훈련 중 안정성을 유지한다.
  • Q-값 타겟의 분포 이탈을 줄임으로써 타겟 네트워크 없이도 안정적인 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1왜 표준 정규화 기법이 오프-정책 TD 강화 학습에서 실패하는가?
  • RQ2온-정책 및 오프-정책 전이를 모두 고려한 하이브리드 정규화 전략이 훈련 안정성을 향상시킬 수 있는가?
  • RQ3CrossNorm은 DDPG 및 TD3와 같은 오프-정책 알고리즘에서 타겟 네트워크의 필요성을 제거할 수 있는가?
  • RQ4MuJoCo 벤치마크 환경에서 CrossNorm은 최신 정규화 및 훈련 기법과 비교해 어떻게 성능을 내는가?
  • RQ5CrossNorm은 연속 제어 과제에서 더 높은 샘플 효율성과 최종 성능을 달성할 수 있는가?

주요 결과

  • CrossNorm은 DDPG 및 TD3와 같은 오프-정책 TD 알고리즘에서 훈련 안정성을 크게 향상시킨다.
  • 이 방법은 타겟 네트워크가 필요 없게 하여 훈련 파이프라인을 단순화한다.
  • CrossNorm은 여러 개의 MuJoCo 벤치마크 과제에서 최신 기술 수준의 성능을 달성한다.
  • 이러한 향상은 온-정책 및 오프-정책 전이 간의 분포 이탈을 더 잘 다루기 때문으로 기인한다.
  • CrossNorm은 오프-정책 RL 환경에서 표준 배치 정규화 및 기타 정규화 기법보다 뛰어난 성능을 낸다.
  • 추가 하이퍼파라미터 튜닝 없이도 더 안정적이고 효율적인 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.