Skip to main content
QUICK REVIEW

[논문 리뷰] ElegantRL-Podracer: Scalable and Elastic Library for Cloud-Native Deep Reinforcement Learning

Xiaoyang Liu, Zechu Li|arXiv (Cornell University)|2021. 12. 11.
Reinforcement Learning in Robotics인용 수 12
한 줄 요약

ElegantRL-Podracer는 토너먼트 기반 앙상블 기법과 단일 GPU 내 대량 병렬 시뮬레이션을 활용하여 수백만 개의 GPU 코어를 활용해 확장성 있고 탄력적인 훈련을 가능하게 하는 클라우드 네이티브 딥 강화학습 라이브러리입니다. RLlib 대비 훈련 효율성과 성능이 뛰어나, 80개의 A100 GPU에서 벽시계 훈련 시간을 최대 40% 감소시키며 운동 및 주식 거래 작업에서 베이스라인을 능가합니다.

ABSTRACT

Deep reinforcement learning (DRL) has revolutionized learning and actuation in applications such as game playing and robotic control. The cost of data collection, i.e., generating transitions from agent-environment interactions, remains a major challenge for wider DRL adoption in complex real-world problems. Following a cloud-native paradigm to train DRL agents on a GPU cloud platform is a promising solution. In this paper, we present a scalable and elastic library ElegantRL-podracer for cloud-native deep reinforcement learning, which efficiently supports millions of GPU cores to carry out massively parallel training at multiple levels. At a high-level, ElegantRL-podracer employs a tournament-based ensemble scheme to orchestrate the training process on hundreds or even thousands of GPUs, scheduling the interactions between a leaderboard and a training pool with hundreds of pods. At a low-level, each pod simulates agent-environment interactions in parallel by fully utilizing nearly 7,000 GPU CUDA cores in a single GPU. Our ElegantRL-podracer library features high scalability, elasticity and accessibility by following the development principles of containerization, microservices and MLOps. Using an NVIDIA DGX SuperPOD cloud, we conduct extensive experiments on various tasks in locomotion and stock trading and show that ElegantRL-podracer substantially outperforms RLlib. Our codes are available on GitHub.

연구 동기 및 목표

  • 복잡한 실세계 환경에서 딥 강화학습(DRL)의 데이터 수집 비용을 낮추기 위해.
  • 클라우드 네이티브 원칙을 기반으로 수백 또는 수천 개의 GPU에 걸쳐 확장성 있고 탄력적인 DRL 훈련을 가능하게 하기 위해.
  • 컨테이너화, 마이크로서비스 및 MLOps를 통해 DRL 프레임워크의 접근성과 성능을 향상시키기 위해.
  • GPU 직접 연결과 단일 GPU 내 대량 병렬화를 활용해 높은 훈련 효율성을 달성하기 위해.
  • 기존 프레임워크들인 RLlib와 비교해 뛰어난 성능과 확장성을 입증하기 위해.

제안 방법

  • 여러 GPU에 걸쳐 수백 개의 풀링된 팟을 포함한 랭킹리스트와 훈련 풀 간의 훈련을 조율하기 위해 토너먼트 기반 앙상블 기법을 사용합니다.
  • 7,000개 이상의 GPU CUDA 코어를 완전히 활용하여 단일 GPU 내 대량 병렬 시뮬레이션을 수행합니다.
  • 확장성과 접근성을 확보하기 위해 쿠버네티스, 컨테이너화, 마이크로서비스 및 MLOps 기반의 클라우드 네이티브 아키텍처를 구현합니다.
  • 대규모 훈련을 지원하기 위해 NVIDIA DGX SuperPOD을 클라우드 인프라로 사용합니다.
  • 개발 및 배포를 간소화하기 위해 지속적 통합 및 배포(CI/CD) 파이프라인을 적용합니다.
  • 복잡한 환경인 주식 거래 및 운동과 같은 환경에서의 효율적 탐색을 지원하기 위해 보상 형상 조정 및 환경 시뮬레이션을 설계합니다.

실험 결과

연구 질문

  • RQ1클라우드 네이티브 DRL 프레임워크는 수천 개의 GPU에 걸쳐 높은 확장성과 탄력성을 달성할 수 있는가?
  • RQ2토너먼트 기반 앙상블 기법은 DRL에서 훈련 효율성과 수렴 속도를 어떻게 향상시키는가?
  • RQ3단일 GPU 내 대량 병렬화가 DRL의 데이터 수집을 얼마나 가속화할 수 있는가?
  • RQ4ElegantRL-Podracer는 복잡한 작업에서 RLlib 대비 훈련 속도와 최종 성능에서 어떻게 비교되는가?
  • RQ5대규모 고성능 DRL 훈련을 지원하면서도 높은 접근성을 유지할 수 있는가?

주요 결과

  • ElegantRL-Podracer는 NASDAQ-100 주식 거래에서 누적 수익률 104.743%와 샤프 비율 2.20을 기록하여, RLlib의 86.274% 수익률과 1.98 샤프 비율을 크게 앞서며 뛰어난 성능을 보였다.
  • 80개의 A100 GPU에서 ElegantRL-Podracer는 약 2,200초 만에 누적 수익률 1.8을 달성하여 높은 확장성과 효율성을 입증했다.
  • 16개 GPU에서 약 4,000초에서 80개 GPU에서 약 2,200초로 훈련 시간이 감소하여 GPU 수가 증가할수록 빠른 속도 향상을 보였다.
  • 유사한 하드웨어 환경에서 RLlib 대비 최대 40%의 훈련 시간 단축을 기록하여 클라우드 규모 훈련에 최적화된 뛰어난 최적화 능력을 입증했다.
  • 주식 거래에서 ElegantRL-Podracer는 연간 수익률 103.591%를 기록하여 인베스코 QQQ ETF 벤치마크인 46.146%를 뛰어넘었다.
  • 높은 변동성(35.357%)과 마진 손실(-17.187%)에도 불구하고, 경쟁력 있는 칼마르 비율 6.02를 유지하여 강력한 위험 조정 성과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.