Skip to main content
QUICK REVIEW

[論文レビュー] Sample Factory: Egocentric 3D Control from Pixels at 100000 FPS with Asynchronous Reinforcement Learning

Aleksei Petrenko, Zhehui Huang|arXiv (Cornell University)|Jun 21, 2020
Reinforcement Learning in Robotics被引用数 16
ひとこと要約

Sample Factory は、非同期かつ GPU アクセラレートされたサンプリングとオフ・ポリシー補正を用いて、1台のマシンで1秒間に10万フレームを超える環境フレームを達成する高スループットの強化学習システムを導入した。これにより、分散クラスタに依存せずに、3D環境における高度なスキルを持つエージェントの効率的訓練が可能になった。実証例として、自己対戦とパopulation-based training を用いたマルチプレイヤーの Doom 環境で頑健なポリシーの訓練が達成された。

ABSTRACT

Increasing the scale of reinforcement learning experiments has allowed researchers to achieve unprecedented results in both training sophisticated agents for video games, and in sim-to-real transfer for robotics. Typically such experiments rely on large distributed systems and require expensive hardware setups, limiting wider access to this exciting area of research. In this work we aim to solve this problem by optimizing the efficiency and resource utilization of reinforcement learning algorithms instead of relying on distributed computation. We present the "Sample Factory", a high-throughput training system optimized for a single-machine setting. Our architecture combines a highly efficient, asynchronous, GPU-based sampler with off-policy correction techniques, allowing us to achieve throughput higher than $10^5$ environment frames/second on non-trivial control problems in 3D without sacrificing sample efficiency. We extend Sample Factory to support self-play and population-based training and apply these techniques to train highly capable agents for a multiplayer first-person shooter game. The source code is available at https://github.com/alex-petrenko/sample-factory

研究の動機と目的

  • ディープ強化学習における大規模分散システムへの依存を減らすために、単一マシンのスループットを最適化すること。
  • 複雑な 3D コントロールタスクにおける、コンmodity ハードウェア上で高いサンプル効率とトレーニングスループットを達成すること。
  • 単一ノード環境でスケーラブルなパopulation-based および自己対戦トレーニングを実現すること。
  • 1台のマシンで極めて高いスループットを達成できることで、大規模分散システムの結果を上回るか同等の結果が得られることを示すこと。

提案手法

  • システムは、複数の環境インスタンスにわたって並列にアクションを生成し、環境遷移を収集する非同期的かつ GPU ベースのサンプラーを使用している。
  • 非同期データ収集によるサンプル効率の低下を補うために、オフ・ポリシー補正技術を採用している。
  • アーキテクチャは、ミニバッチの経験データを用いた効率的な勾配更新を可能にする、非同期的プロキシマル・ポリシー最適化(APPO)の周囲に構築されている。
  • 集中型の学習者コンponent が複数のアクトロから勾配を集約し、非同期的にポリシーモデルを更新している。
  • 勝率に基づいてパラメータを動的に変更し、性能が低いエージェントを再初期化することで、自己対戦およびパopulation-based training をサポートしている。
  • 1枚の GPU でのバッチ推論を活用してスループットを最大化し、36コア、4 GPU サーバーで最大 130,000 FPS を達成した。

実験結果

リサーチクエスチョン

  • RQ11台のマシンで 3D コントロールタスクにおいて、1秒間に 100,000 フレームを超えるスループットを達成できるか?
  • RQ2高スループットの非同期サンプリングと組み合わせた場合、オフ・ポリシー補正技術がサンプル効率を維持できるか?
  • RQ3分散インfrastrucutureなしで、自己対戦およびパopulation-based training が1台のマシン上で効果的にスケーリング可能か?
  • RQ4高スループットの1台マシントレーニングは、スクリプト化された相手に対して訓練されたものよりも一般化性能が優れているか?
  • RQ5このようなシステムは、Doom のような複雑で戦略的な 3D マルチプレイヤーゲームで、高水準な競争力を発揮するエージェントを訓練できるか?

主な発見

  • Sample Factory は、1台の 36コア、4 GPU サーバーでピークスループットが 130,000 フレーム/秒に達し、評価されたすべての 3D 環境で 100,000 FPS を超えた。
  • スクリプト化されたボットに対して訓練されたエージェントは 100% の勝率を記録したが、相手タイプに過剰適合していたため、頑健性に欠けていた。
  • 自己対戦トレーニングでは、パopulation-based アプローチにより多様な戦略が生成され、最終エージェントはスクリプト・ボットで訓練されたエージェントに対して 100 試合中 78 勝を挙げた。
  • 自己対戦エージェントは、スクリプト・ボットで訓練されたエージェントに対して 78 勝、19 引き分け、3 敗を記録し、優れた一般化性能と頑健性を示した。
  • このシステムにより、1台のサーバーで 1v1 の Doom 環境において 8 体のエージェントをそれぞれ 25 億フレーム分、合計で約 18 年分のシミュレーテッド経験を消費するトレーニングが可能になった。
  • 高いパフォーマンスを発揮したが、音声認識やマルチモーダルセンサ統合の欠如により、エキスパート人間プレーヤーに及ばない場合がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。