Skip to main content
QUICK REVIEW

[論文レビュー] High-Throughput Synchronous Deep RL

Iou Jen Liu, Raymond A. Yeh|arXiv (Cornell University)|Dec 17, 2020
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

HTS-RL は、バッチ同期と非同期な環境相互作用を組み合わせることで、陳腐化した方策の問題を解消しながら、同時に学習とロールアウトを実行できる高スループットな同期型深層強化学習フレームワークを提案する。同期ベースラインより2–6倍速く学習が可能であり、IMPALA や他の最先端の非同期手法を上回る高いサンプル効率と安定性を達成し、4つのGPUを搭載した単一マシンでも効率的な学習が可能である。

ABSTRACT

Deep reinforcement learning (RL) is computationally demanding and requires processing of many data points. Synchronous methods enjoy training stability while having lower data throughput. In contrast, asynchronous methods achieve high throughput but suffer from stability issues and lower sample efficiency due to `stale policies.' To combine the advantages of both methods we propose High-Throughput Synchronous Deep Reinforcement Learning (HTS-RL). In HTS-RL, we perform learning and rollouts concurrently, devise a system design which avoids `stale policies' and ensure that actors interact with environment replicas in an asynchronous manner while maintaining full determinism. We evaluate our approach on Atari games and the Google Research Football environment. Compared to synchronous baselines, HTS-RL is 2-6$ imes$ faster. Compared to state-of-the-art asynchronous methods, HTS-RL has competitive throughput and consistently achieves higher average episode rewards.

研究の動機と目的

  • 深層強化学習における学習の安定性とスループットのトレードオフを解決すること。
  • 非同期手法に一般的に見られる陳腐化した方策の問題を解消しながら、高いデータスループットを維持すること。
  • 限られたハードウェアリソースを備えた単一マシン上で、効率的で決定論的かつ再現可能な学習を可能にすること。
  • 同期手法と同等のサンプル効率と安定性を達成しながら、非同期手法と同様にスループットをスケーリングすること。
  • アタリやGoogle Research Footballのような複雑な環境において、生の画像入力を用いた適用可能性を示すこと。

提案手法

  • HTS-RL は、別々のアクターと学習者を用いて、同時に学習とロールアウトを実行し、データ収集とパラメータ更新を分離する。
  • バッチ同期を用いて、行動方策とターゲット方策の間に常に1ステップの遅延を保証し、陳腐化した方策の問題を回避する。
  • アクターは環境のレプリカを非同期で相互作用させることで、無駄な待機時間を削減し、スループットを向上させる。
  • 定期的なインターバルでパラメータをバッチで同期することで、完全な決定論的で再現可能な学習を維持する。
  • 非遅延更新の収束特性を保つ「1ステップ遅延勾配更新ルール」を採用する。
  • A2C、PPO、ACKTR といった市販のアルゴリズムと互換性があり、即座に統合可能である。

実験結果

リサーチクエスチョン

  • RQ1学習の安定性とサンプル効率を損なわずに、高スループットな深層強化学習を達成できるか?
  • RQ2非同期手法における陳腐化した方策の問題を、高いスループットを維持したまま解消できるか?
  • RQ3非同期な環境相互作用とバッチ同期を組み合わせることで、収束性と決定論的特性が保持されるか?
  • RQ4HTS-RL は、1台のマシンのみを用いて、アタリやGoogle Research Footballのような複雑な環境で優れた性能を達成できるか?
  • RQ5実世界の環境において、アクター数や同期インターバルの変化に伴い、HTS-RL はどのようにスケーリングするか?

主な発見

  • HTS-RL は、アタリおよびGFootball環境において、同期型のA2CおよびPPOベースラインと比較して2–6倍速い学習を達成した。
  • アタリゲームでは、最先端の非同期手法であるIMPALAと比較して、平均エピソード報酬が3.7倍高い結果を得た。
  • GFootball環境では、IMPALAと比較して平均ゲームスコアが43%高い結果を得た。
  • GFootballで16のアクターを用いた場合、HTS-RL はすべての設定で一貫した平均スコア0.82を維持し、完全な決定論的性質を示した。
  • 同期インターバルを長くするとスループットが向上し、512ステップのインターバルでピークの1377ステップ/秒に達した。
  • HTS-RL は、4つのGPUのみを用いて、GFootballで生の画像入力を用いたマルチエージェント学習を成功させた。これは、同種の設定において初の成功例である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。