Skip to main content
QUICK REVIEW

[논문 리뷰] CrossQ: Batch Normalization in Deep Reinforcement Learning for Greater Sample Efficiency and Simplicity

Aditya Bhatt, Daniel Palenicek|arXiv (Cornell University)|2019. 02. 14.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

CrossQ는 타겟 네트워크를 제거하고 비평가 네트워크에 전략적으로 배치 정규화(Batch Normalization)를 적용함으로써 연속 제어 작업에서 최신 기술 수준의 샘플 효율성을 달성하는 경량 딥 강화학습 알고리즘을 소개한다. 이로 인해 업데이트 대 데이터(UTD) 비율이 1임에도 불구하고 REDQ와 DroQ보다 최대 4배 빠른 훈련 속도를 기록하며, 복잡한 앙상블 방법을 피할 수 있다.

ABSTRACT

Sample efficiency is a crucial problem in deep reinforcement learning. Recent algorithms, such as REDQ and DroQ, found a way to improve the sample efficiency by increasing the update-to-data (UTD) ratio to 20 gradient update steps on the critic per environment sample. However, this comes at the expense of a greatly increased computational cost. To reduce this computational burden, we introduce CrossQ: A lightweight algorithm for continuous control tasks that makes careful use of Batch Normalization and removes target networks to surpass the current state-of-the-art in sample efficiency while maintaining a low UTD ratio of 1. Notably, CrossQ does not rely on advanced bias-reduction schemes used in current methods. CrossQ's contributions are threefold: (1) it matches or surpasses current state-of-the-art methods in terms of sample efficiency, (2) it substantially reduces the computational cost compared to REDQ and DroQ, (3) it is easy to implement, requiring just a few lines of code on top of SAC.

연구 동기 및 목표

  • 높은 UTD 비율이나 복잡한 앙성 방법에 의존하지 않고 딥 강화학습의 샘플 효율성을 향상시키는 것.
  • 기존 연구 결과와는 반대로 배치 정규화가 이완 정책 딥 강화학습에서 훈련 안정성과 성능 향상에 기여할 수 있는지 조사하는 것.
  • 타겟 네트워크와 비평가 앙상블을 제거함으로써 샘플 효율적인 강화학습의 계산 비용을 줄이는 것.
  • 간단한 아키텍처 수정—배치 정규화, 넓은 비평가, 타겟 네트워크 제거—가 REDQ 및 DroQ와 같은 최신 기술 수준 알고리즘을 초월할 수 있음을 보여주는 것.

제안 방법

  • 기존에 훈련 안정성에 사용되는 타겟 네트워크를 SAC에서 제거하여 계산 오버헤드를 줄이는 것.
  • 훈련 안정성 향상과 Q-값 추정 편향 감소를 위해 비평가 네트워크에 철저히 설계된 방식으로 배치 정규화를 적용하는 것.
  • empirical 발견에 기반해 넓은 네트워크가 훈련하기 쉬우므로, 최적화 및 학습 성능 향상을 위해 더 넓은 비평가 네트워크를 사용하는 것.
  • 기존 REDQ 및 DroQ가 UTD=20을 사용하는 데 비해, 매우 낮은 UTD 비율 1을 유지하여 기울기 계산 비용을 크게 줄이는 것.
  • 기본적인 SAC 구성 요소(예: Adam 최적화기, 엔트로피 계수)를 유지하나, 네트워크 아키텍처와 훈련 동역학을 수정하여 안정성과 샘플 효율성을 향상시키는 것.
  • 배치 정규화, 타겟 네트워크 제거, 네트워크 너비의 기여도를 분리하기 위해 아블레이션 스터디를 수행하는 것.

실험 결과

연구 질문

  • RQ1기존의 부정적인 결과와는 반대로, 이완 정책 딥 강화학습에 배치 정규화를 성공적으로 적용할 수 있는가?
  • RQ2SAC에서 타겟 네트워크를 제거하면 성능이 떨어지는가, 아니면 배치 정규화와 넓은 네트워크와 같은 아키텍처 개선으로 보완될 수 있는가?
  • RQ3기타 구성 요소가 적절히 최적화된다면, 낮은 UTD 비율(예: 1)도 최신 기술 수준의 샘플 효율성을 달성할 수 있는가?
  • RQ4배치 정규화, 넓은 비평가, 타겟 네트워크 제거의 상대적 기여도는 샘플 효율성과 훈련 속도에 어떻게 기여하는가?

주요 결과

  • CrossQ는 모든 MuJoCo 환경에서 최신 기술 수준의 샘플 효율성을 달성하여, 학습 속도와 최종 성능 모두에서 REDQ 및 DroQ를 능가한다.
  • UTD 비율이 오직 1임에도 불구하고, UTD=20을 사용하는 REDQ 및 DroQ와 동일하거나 뛰어난 성능을 기록함으로써, 높은 UTD 비율이 샘플 효율성에 필수적인 것은 아님을 입증한다.
  • 낮은 UTD 비율과 타겟 네트워크 제거 덕분에, CrossQ는 REDQ 및 DroQ 대비 벽시계 훈련 시간을 최대 4배 단축시킨다.
  • 타겟 네트워크 제거가 배치 정규화와 결합될 경우 실행 가능하고 효과적이며, 기존의 타겟 네트워크가 안정성에 필수적이라는 전통적 믿음을 도전한다.
  • 타겟 네트워크가 없더라도 배치 정규화는 이완 정책 강화학습에서 훈련 안정성과 샘플 효율성을 크게 향상시키며, LayerNorm 및 ReLU-over-max와 같은 다른 정규화 기법보다도 뛰어난 성능을 보인다.
  • 정규화된 Q-값 편향은 성능과 직접적인 상관관계가 없음을 확인했다. CrossQ는 REDQ보다 더 높은 편향을 보였지만, 특히 Humanoid와 같은 도전적인 작업에서 더 빠른 학습 속도를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.