Skip to main content
QUICK REVIEW

[논문 리뷰] Low-Precision Reinforcement Learning: Running Soft Actor-Critic in Half Precision

Johan Björck, Xiangyu Chen|arXiv (Cornell University)|2021. 02. 26.
Reinforcement Learning in Robotics참고 문헌 56인용 수 7
한 줄 요약

이 논문은 연속 제어 환경에서 소프트 액터-크리틱(SAC) 에이전트를 반정밀도(bfloat16/fp16)로 훈련시킬 수 있음을 입증하며, 성능 저하 없이 여섯 가지 수치 안정성 기법을 도입함으로써 이를 가능하게 한다. 제안된 방법들—예를 들어 Adam에서 두 번째 모멘트의 제곱근을 저장하고 산술 연산 순서를 재정렬하는 것—은 메모리와 계산량을 줄이며, 하이퍼파rameter 조정 없이도 전정밀도 성능을 유지한다.

ABSTRACT

Low-precision training has become a popular approach to reduce compute requirements, memory footprint, and energy consumption in supervised learning. In contrast, this promising approach has not yet enjoyed similarly widespread adoption within the reinforcement learning (RL) community, partly because RL agents can be notoriously hard to train even in full precision. In this paper we consider continuous control with the state-of-the-art SAC agent and demonstrate that a naïve adaptation of low-precision methods from supervised learning fails. We propose a set of six modifications, all straightforward to implement, that leaves the underlying agent and its hyperparameters unchanged but improves the numerical stability dramatically. The resulting modified SAC agent has lower memory and compute requirements while matching full-precision rewards, demonstrating that low-precision training can substantially accelerate state-of-the-art RL without parameter tuning.

연구 동기 및 목표

  • 최신의 SAC 알고리즘을 사용하여 연속 제어 작업에서 저정밀도 강화학습을 가능하게 하기 위해.
  • 감독학습의 저정밀도 기법을 강화학습에 직접 적용할 수 없게 만드는 수치적 불안정성을 해결하기 위해.
  • 전정밀도 성능을 유지하면서 메모리와 계산량을 줄이는 단순하고 즉시 적용 가능한 수정 사항을 개발하기 위해.
  • 저정밀도 강화학습이 재학습이나 하이퍼파rameter 조정 없이도 가능함을 입증하기 위해.
  • 향후 저정밀도 강화학습 분야의 연구를 가속화하기 위해 재현 가능하고 구현 가능한 코드베이스와 방법론을 제공하기 위해.

제안 방법

  • Adam 옵티마이저에서 두 번째 모멘트의 제곱근을 저장하여 동적 범위를 줄이고 저정밀도에서의 수치 안정성을 향상시키는 것을 제안한다.
  • 취소 오차를 최소화하고 기울기 갱신의 정밀도를 향상시키기 위해 산술 연산 순서를 재정렬한다.
  • 손실 스케일링 및 NaN/무한대 처리 전략을 강화학습에 적합하게 조정하지만, 이들만으로는 충분하지 않다.
  • 가중치와 활성화에 대해 fp16을 사용하는 혼합 정밀도 훈련을 적용하지만, 제안된 안정성 기법과 함께 사용할 때에만 가능하다.
  • bfloat16과 8비트 고정점 포맷을 포함한 다양한 저정밀도 형식을 시뮬레이션하기 위해 qtorch를 활용하여 탄탄함을 검증한다.
  • 주요 구성 요소(예: 타겟 네트워크)에 대해 전정밀도 통계를 유지하면서도 저정밀도로 훈련하는 수정된 훈련 루프를 도입한다.

실험 결과

연구 질문

  • RQ1감독학습에서 사용하는 표준 저정밀도 훈련 기법을 강화학습의 SAC에 직접 적용할 수 있는가?
  • RQ2SAC의 fp16 훈련에서 수치 안정성을 확보하기 위해 어떤 구체적인 수정이 필요한가?
  • RQ3저정밀도 SAC가 하이퍼파rameter 조정 없이도 전정밀도 성능을 달성할 수 있는가?
  • RQ4제안된 기법을 사용해 반정밀도로 SAC를 훈련할 경우, 메모리와 계산 시간은 얼마나 절감되는가?
  • RQ5제안된 기법들이 다양한 하이퍼파rameter 설정과 환경에서 얼마나 탄탄한가?

주요 결과

  • 감독학습의 저정밀도 기법(예: 손실 스케일링, 혼합 정밀도)을 난이도 있게 적용할 경우, SAC 훈련에서 경쟁력 있는 성능을 달성하지 못한다.
  • 제안된 여섯 가지 수정 사항을 통해 상태 기반 및 픽셀 기반 연속 제어 환경에서 전정밀도 성능을 달성한 fp16 훈련이 가능해진다.
  • 제안된 기법을 사용해 반정밀도로 훈련할 경우 약 50%의 메모리 사용량 감소와 계산 시간의 급격한 가속화가 이루어진다.
  • 랜덤 하이퍼파rameter 설정에서도 안정성이 유지됨을 확인하여, 최적화된 설정 외의 환경에서도 탄탄함을 입증한다.
  • 절단 분석을 통해 각 제안된 기법이 수치 안정성에 기여하며, 특히 두 번째 모멘트의 제곱근 저장이 가장 큰 영향을 미친다.
  • 코드와 구현 사항이 공개되어 재현 가능성과 향후 저정밀도 RL 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.