Skip to main content
QUICK REVIEW

[논문 리뷰] RL-Scope: Cross-Stack Profiling for Deep Reinforcement Learning Workloads

James P. Gleeson, Srivatsan Krishnan|arXiv (Cornell University)|2021. 02. 08.
Reinforcement Learning in Robotics참고 문헌 16인용 수 4
한 줄 요약

RL-Scope는 딥 레이어닝 강화학습(RL) 워크로드에서 CPU 및 GPU 자원 사용량을 고수준 알고리즘 연산으로 정확하게 할당하는 크로스스택 프로파일러이며, 최대 1.9배까지 훈련 시간을 증가시킬 수 있는 프로파일링 오버헤드를 보정한다. 이는 RL 워크로드가 지도학습보다 본질적으로 GPU에 의존도가 낮으며, 주요 병목은 고수준 파이썬 코드, CUDA API 호출, ML 백엔드 추상화에 있음을 드러낸다. 특히 PyTorch와 Tensorflow Eager 구현 간 런타임 차이가 2.34×10^15배에 이르는 것은 추상화 오버헤드 때문이며, 이는 시스템 수준의 성능 영향을 분명히 보여준다.

ABSTRACT

Deep reinforcement learning (RL) has made groundbreaking advancements in robotics, data center management and other applications. Unfortunately, system-level bottlenecks in RL workloads are poorly understood; we observe fundamental structural differences in RL workloads that make them inherently less GPU-bound than supervised learning (SL). To explain where training time is spent in RL workloads, we propose RL-Scope, a cross-stack profiler that scopes low-level CPU/GPU resource usage to high-level algorithmic operations, and provides accurate insights by correcting for profiling overhead. Using RL-Scope, we survey RL workloads across its major dimensions including ML backend, RL algorithm, and simulator. For ML backends, we explain a $2.3 imes$ difference in runtime between equivalent PyTorch and TensorFlow algorithm implementations, and identify a bottleneck rooted in overly abstracted algorithm implementations. For RL algorithms and simulators, we show that on-policy algorithms are at least $3.5 imes$ more simulation-bound than off-policy algorithms. Finally, we profile a scale-up workload and demonstrate that GPU utilization metrics reported by commonly used tools dramatically inflate GPU usage, whereas RL-Scope reports true GPU-bound time. RL-Scope is an open-source tool available at https://github.com/UofT-EcoSystem/rlscope .

연구 동기 및 목표

  • 딥 레이어닝 강화학습(RL) 워크로드에 대해 정확하고 크로스스택 기반의 프로파일링 도구가 부족한 문제를 해결하기 위해, 이는 자원 사용 패턴에서 지도학습(SL) 워크로드와 본질적으로 다름.
  • 기존 GPU 중심의 프로파일러가 가림을 입히는, 특히 고수준 언어 실행과 프로파일링 오버헤드로 인한 시스템 수준의 병목을 특정하고 정량화하기 위해.
  • 재컴파일 없이도 여러 ML 백엔드(예: PyTorch, TensorFlow)와 시뮬레이터에서 고수준 RL 연산으로 CPU 및 GPU 시간을 세밀하게 정확하게 할당할 수 있도록 하기 위해.
  • 특히 CPU 측면의 시뮬레이션과 API 호출 오버헤드가 높은 RL 워크로드에서 최대 1.9배까지 훈련 시간을 증가시킬 수 있는 CPU 프로파일링 오버헤드를 보정하기 위해.
  • ML 백엔드 선택, 실행 모드, 알고리즘 설계가 RL 훈련 효율성에 미치는 영향을 실질적으로 파악할 수 있는 통찰을 제공하기 위해.

제안 방법

  • RL-Scope는 사용자 정의 작업을 고수준 코드에 주석으로 추가하는 파이썬 API를 사용하여, 저수준 CPU 및 GPU 실행 시간을 이 의미 단위로 범주화한다.
  • GPU 커널, CUDA API 호출, 시뮬레이터, ML 백엔드에서 크로스스택 프로파일링 데이터를 수집하고, 이들을 고수준 주석과 연관지켜 종단 간 추적 가능성을 확보한다.
  • CPU 시간 오버헤드를 실제 오버헤드의 16.0% 이내로 줄이는 校정 기반 보정 메커니즘을 구현하여 정확한 런타임 할당을 가능하게 한다.
  • 재컴파일 없이도 여러 ML 백엔드(PyTorch, TensorFlow)와 시뮬레이터를 지원하여 RL 프레임워크 간 광범위한 호환성을 확보한다.
  • NVTX 주석을 활용하고 저수준 프로파일링 시스템(Nsight 등)과 통합하지만, 비공개 분석 백엔드를 피하여 전체 校정 및 보정을 가능하게 한다.
  • 고수준 코드, ML 백엔드, GPU 커널 간 전환을 포함한 다양한 스택 레벨 간의 프로파일링 데이터를 집계하고 연관지켜 오프라인 분석을 가능하게 한다.

실험 결과

연구 질문

  • RQ1동일한 RL 알고리즘을 구현한 PyTorch와 TensorFlow 간에 2.34×10^15배의 런타임 차이가 발생하는 이유는 무엇이며, 이러한 격차를 초래하는 시스템 수준의 요인은 무엇인가?
  • RQ2온정책 대비 오프정책 RL 알고리즘 선택이 시뮬레이션 기반 및 GPU 기반 실행 시간의 균형에 어떤 영향을 미치는가?
  • RQ3일반적인 GPU 활용도 메트릭이 RL 워크로드에서 실제 GPU 기반 실행 시간을 최대 1.9배까지 과대평가하는 이유는 무엇이며, 그 원인은 무엇인가?
  • RQ4기록 코드의 프로파일링 오버헤드가 RL 워크로드의 훈련 시간을 얼마나 증가시키며, 이를 정확하게 보정할 수 있는가?
  • RQ5ML 백엔드 실행 모드(Eager 대비 Graph/Autograph 등)가 RL의 전체 훈련 효율성에 어떤 역할을 하는가?

주요 결과

  • Eager 실행 모델을 구현한 PyTorch는 TensorFlow Eager 구현 대비 최대 4.76×10^6배 빠르며, 이는 ML 백엔드 내의 추상화와 오버헤드 감소 때문이다.
  • 동일한 RL 알고리즘을 구현한 PyTorch와 TensorFlow 간 런타임 차이는 최대 2.34×10^15배에 이르며, 주로 TensorFlow에서 과도하게 추상화된 알고리즘 구현 방식 때문이었다.
  • 온정책 RL 알고리즘은 오프정책 알고리즘 대비 최소 3.48×10^6배 더 시뮬레이션 기반 실행 시간이 길며, 이는 시뮬레이션 오버헤드가 훈련 시간의 주요 요인임을 시사한다.
  • 일반적인 GPU 활용도 메트릭은 스케일업 워크로드에서 실제 GPU 기반 실행 시간을 최대 1.9배까지 과대평가할 수 있으며, 이는 잘못된 성능 평가로 이어질 수 있다.
  • 기록 코드의 프로파일링 오버헤드는 RL 워크로드에서 총 훈련 시간을 최대 1.9배까지 증가시킬 수 있으나, RL-Scope는 이를 실제 오버헤드의 16.0% 이내로 보정할 수 있다.
  • 이 도구는 RL 워크로드가 지도학습 워크로드보다 본질적으로 GPU에 의존도가 낮으며, CPU 측면의 시뮬레이션, 고수준 파이썬 실행, CUDA API 호출에 많은 시간이 소요됨을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.