Skip to main content
QUICK REVIEW

[논문 리뷰] High-Throughput Synchronous Deep RL

Iou Jen Liu, Raymond A. Yeh|arXiv (Cornell University)|2020. 12. 17.
Reinforcement Learning in Robotics인용 수 8
한 줄 요약

HTS-RL는 배치 동기화와 비동기 환경 상호작용을 통해 동시에 학습과 롤아웃을 수행하면서도 오래된 정책 문제를 제거함으로써 고처리량 동기 딥 강화학습 프레임워크를 제안한다. 이는 동기 기반 방법 대비 2–6배 빠른 학습을 달성하며, 더 높은 샘플 효율성과 안정성을 확보한 채 최신 이방식 방법인 IMPALA를 능가한다. 이로 인해 4개의 GPU를 탑재한 단일 머신에서도 효율적인 학습이 가능해진다.

ABSTRACT

Deep reinforcement learning (RL) is computationally demanding and requires processing of many data points. Synchronous methods enjoy training stability while having lower data throughput. In contrast, asynchronous methods achieve high throughput but suffer from stability issues and lower sample efficiency due to `stale policies.' To combine the advantages of both methods we propose High-Throughput Synchronous Deep Reinforcement Learning (HTS-RL). In HTS-RL, we perform learning and rollouts concurrently, devise a system design which avoids `stale policies' and ensure that actors interact with environment replicas in an asynchronous manner while maintaining full determinism. We evaluate our approach on Atari games and the Google Research Football environment. Compared to synchronous baselines, HTS-RL is 2-6$ imes$ faster. Compared to state-of-the-art asynchronous methods, HTS-RL has competitive throughput and consistently achieves higher average episode rewards.

연구 동기 및 목표

  • 딥 강화학습에서 학습 안정성과 처리량 간의 상충 관계를 해결하기 위해.
  • 이방식 방법에서 흔히 발생하는 오래된 정책 문제를 제거하면서도 높은 데이터 처리량을 유지하기 위해.
  • 제한된 하드웨어 자원을 가진 단일 머신에서 효율적이고 결정론적이며 재현 가능한 학습을 가능하게 하기 위해.
  • 이방식 방법이 처리량을 확장하는 방식으로 동기 방법 수준의 높은 샘플 효율성과 안정성을 확보하기 위해.
  • 아틀라스 및 구글 리서치 풋볼과 같은 복잡한 환경에서 원시 이미지 입력을 사용한 적용 가능성을 입증하기 위해.

제안 방법

  • HTS-RL은 별도의 액터와 러닝 기반으로 동시에 학습과 롤아웃을 수행함으로써 데이터 수집과 파라미터 업데이트를 분리한다.
  • 행동 정책와 타겟 정책 간 일정한 1단계 지연을 보장하기 위해 배치 동기화를 사용하여 오래된 정책 문제를 방지한다.
  • 액터는 환경 복제본과 비동기적으로 상호작용함으로써 정지 시간을 줄이고 처리량을 향상시킨다.
  • 정기적인 간격으로 파라미터를 배치 단위로 동기화함으로써 전체 결정론성과 재현 가능성을 유지한다.
  • 지연되지 않은 업데이트의 수렴 성질을 유지하는 '1단계 지연 그래디언트' 업데이트 규칙을 적용한다.
  • A2C, PPO, ACKTR와 같은 표준 알고리즘과의 호환성을 확보하여 즉시 통합이 가능한 플러그 앤 플레이 아키텍처를 제공한다.

실험 결과

연구 질문

  • RQ1학습 안정성과 샘플 효율성을 희생시키지 않고 고처리량 딥 강화학습을 달성할 수 있는가?
  • RQ2이방식 방법에서 흔히 발생하는 오래된 정책 문제를 유지보수하면서도 고처리량을 확보할 수 있는가?
  • RQ3비동기 환경 상호작용과 함께 배치 동기화가 수렴성과 결정론성을 유지하는가?
  • RQ4HTS-RL은 단일 머신에서 아틀라스 및 구글 리서치 풋볼과 같은 복잡한 환경에서 뛰어난 성능을 달성할 수 있는가?
  • RQ5실세계 환경에서 액터 수와 동기화 간격을 변화시켰을 때 HTS-RL의 확장성은 어떻게 나타나는가?

주요 결과

  • HTS-RL은 아틀라스 및 GFootball 환경에서 동기 A2C와 PPO 기반 방법 대비 2–6배 더 빠른 학습 속도를 기록한다.
  • 아틀라스 게임에서 HTS-RL은 최신 이방식 방법인 IMPALA보다 평균 에피소드 보상에서 3.7배 높은 성능을 달성한다.
  • GFootball 환경에서 HTS-RL은 IMPALA보다 평균 게임 스코어에서 43% 높은 성능을 기록한다.
  • GFootball에서 16개의 액터를 사용할 경우, HTS-RL은 모든 설정에서 일관된 평균 스코어 0.82를 유지하며 완전한 결정론성을 입증한다.
  • 동기화 간격이 길어질수록 처리량이 증가하여 512단계 간격일 때 최대 1377스텝/초에 도달한다.
  • HTS-RL은 단지 4개의 GPU만을 사용하여 GFootball에서 원시 이미지 입력을 활용한 다중 에이전트 학습을 성공적으로 수행했으며, 이는 유사한 설정에서의 첫 번째 사례이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.