Skip to main content
QUICK REVIEW

[論文レビュー] Accelerating Reinforcement Learning through GPU Atari Emulation

Steven Dalton, Iuri Frosio|arXiv (Cornell University)|Jul 19, 2019
Reinforcement Learning in Robotics参考文献 25被引用数 16
ひとこと要約

本論文では、CUDAを活用したAtari 2600エミュレータであるCuLEを紹介する。このエミュレータは強化学習環境をGPU上で直接実行可能であり、1つのGPUで最大1億5500万フレーム/時間の性能を達成し、CPUベースのシステムを上回る。CPU-GPU間通信のボトルneckを回避し、ゲーム環境を大規模に並列化することで、A2C+V-traceを用いた学習を高速化し、1GPUで68K FPS、4GPUで187K FPSを達成。収束時間は著しく短縮されつつ、CPUベースの環境と同等のポリシー性能を維持する。

ABSTRACT

We introduce CuLE (CUDA Learning Environment), a CUDA port of the Atari Learning Environment (ALE) which is used for the development of deep reinforcement algorithms. CuLE overcomes many limitations of existing CPU-based emulators and scales naturally to multiple GPUs. It leverages GPU parallelization to run thousands of games simultaneously and it renders frames directly on the GPU, to avoid the bottleneck arising from the limited CPU-GPU communication bandwidth. CuLE generates up to 155M frames per hour on a single GPU, a finding previously achieved only through a cluster of CPUs. Beyond highlighting the differences between CPU and GPU emulators in the context of reinforcement learning, we show how to leverage the high throughput of CuLE by effective batching of the training data, and show accelerated convergence for A2C+V-trace. CuLE is available at https://github.com/NVLabs/cule .

研究の動機と目的

  • CPUベースのAtariエミュレーションと限界的なCPU-GPU帯域幅が引き起こす深層強化学習の計算ボトルneckを解消すること。
  • CUDAを用いたAtari Learning Environment (ALE) のGPUへの移植により、高スループットかつスケーラブルな強化学習を実現すること。
  • GPUアクセラレートされた環境シミュレーションが、大規模なCPUクラスターよりも性能を上回るか同等の性能を発揮しつつ、学習時間を短縮できることを示すこと。
  • CuLEで学習されたポリシーが、OpenAI Gymのような標準環境へ一般化できることを検証すること。

提案手法

  • Atari Learning Environment (ALE) をCUDAに移植し、GPUメモリ上に直接ゲームフレームをレンダリングすることで、CPU-GPU間データ転送を回避するCuLEを構築。
  • 1つのGPU上で数千ものAtariゲーム環境を並列に実行し、GPUのスレッドレベル並列処理のスケーラビリティを活用。
  • 特にA2C+V-traceアルゴリズム向けに、CuLEからの高スループットデータを効率的に消費するバッチ処理戦略を実装。
  • 複数の行動ポリシーが並列に生成するデータを用いた学習を安定化させるために、V-traceの非政策補正を採用。
  • 複数のGPUおよびシステム構成で性能を測定し、FPS、収束速度、ポリシー性能を比較。
  • テストスコアの比較を通じて正しさを検証し、CuLEとOpenAI Gym環境との間でポリシーの一般化が成立することを確認。

実験結果

リサーチクエスチョン

  • RQ1GPUアクセラレートされたAtariエミュレーションは、フレーム/秒および学習スループットの観点で、CPUベースのエミュレーションを著しく上回ることができるか?
  • RQ2CuLEの高スループットデータ生成は、A2C+V-trace学習における収束速度にどのように影響するか?
  • RQ3GPU上で並列化されたAtariエミュレーションにおけるスレッドの分散(スレッド発散)は、性能にどの程度の影響を及えるか?
  • RQ4CuLEで学習されたポリシーは、OpenAI Gymのような標準環境へ一般化可能で、性能劣化がないか?
  • RQ5DRL学習におけるGPU利用度、命令レベルスループット、計算効率の間には、どのようなトレードオフがあるか?

主な発見

  • CuLEは1つのGPUで最大1億5500万フレーム/時間の性能を達成し、これは従来、大規模なCPUクラスタでのみ達成可能であった性能である。
  • 1GPUでは、推論時で39K~125K FPS、A2C+V-trace学習時で26K~68K FPSを達成し、CPUベースのシステムを著しく上回る。
  • 4GPUを用いることで、学習時で187K FPSにスケーリングされ、IMPALAのような大規模分散システムと同等のスループットを達成。
  • CuLEで学習されたポリシーは、OpenAI Gym環境で得られるテストスコアと区別できない結果を示し、正しさと一般化性を確認。
  • CPUベースのエミュレーションでは、スレッド発散の欠如により初期のFPSピークが観察されない。これに対してGPUエミュレーションでは、相関する初期状態が一時的な性能スパイクを引き起こす。
  • 本研究では、CPU-GPU通信帯域幅とCPU並列処理の限界が、従来のDRL学習パイプラインにおける主なボトルneckであると特定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。