Skip to main content
QUICK REVIEW

[論文レビュー] Bigger, Better, Faster: Human-level Atari with human-level efficiency

Max Schwarzer, Johan Obando-Ceron|arXiv (Cornell University)|May 30, 2023
Human Pose and Action Recognition被引用数 5
ひとこと要約

本論文は、神経ネットワークの幅を拡大し、周期的なリセットや高いリプレイ比といった効率的な訓練技術を採用することで、2時間のプレイ時間でのみ、Atari 100Kベンチマークで人間を上回る性能を達成する値ベースの強化学習エージェントBBFを紹介する。これは、DQNが256時間の訓練を要する性能を、わずか20万環境ステップで達成する。BBFは、モデルフリー強化学習におけるサンプル効率の新基準を確立し、過去の手法に比べて最大16倍のサンプル効率向上を達成するとともに、モデルベースのベースラインと比較して実行時間を4倍短縮した。

ABSTRACT

We introduce a value-based RL agent, which we call BBF, that achieves super-human performance in the Atari 100K benchmark. BBF relies on scaling the neural networks used for value estimation, as well as a number of other design choices that enable this scaling in a sample-efficient manner. We conduct extensive analyses of these design choices and provide insights for future work. We end with a discussion about updating the goalposts for sample-efficient RL research on the ALE. We make our code and data publicly available at https://github.com/google-research/google-research/tree/master/bigger_better_faster.

研究の動機と目的

  • Atari 100Kベンチマークで、人間水準の性能を達成するモデルフリー深層強化学習エージェントを開発すること。この際、人間学習と同等のサンプル効率を実現すること。
  • 値ベース強化学習における、ニューラルネットワークの幅とリプレイ比のスケーリングが、サンプル効率と性能に与える影響を調査すること。
  • サンプル制約のある環境における大規模ネットワークの安定的かつ効率的な訓練を可能にする、主なアーキテクチャ的および訓練的要因を同定すること。
  • 最小限の環境インタラクションで超人間レベルの性能を達成することにより、サンプル効率の強化学習のための新たなベンチマークのゴールポストを提示すること。

提案手法

  • BBFは、値関数の表現力向上を目的として、幅と深さを拡大したワイド残差ネットワーク(ResNet)アーキテクチャを採用し、優先順位付き経験再生を用いた二重DQNベースのアルゴリズムで訓練される。
  • エージェントは、高いリプレイ比(最大8)と周期的なネットワークリセットを用いて、長期間の訓練中でも危険な忘却(catastrophic forgetting)を軽減しながら、柔軟性を維持する。
  • 報酬信号を追加せずに、観測値に対して自己教師型の対照的学習を組み込むことで、特徴表現学習を向上させる。
  • 訓練パイプラインには、スタックドアクションと、リプレイ比を段階的に増加させるカリキュラムスタイルの訓練が含まれ、初期段階での学習安定化を図る。
  • 性能評価には、26種類のAtari 100Kゲームにおける人間正規化スコアの四分位平均(IQM)を用い、主な構成要素に関するアブレーションスタディも実施する。
  • 計算効率が高く、リプレイ比2の条件下で、約1時間のA100 GPU時間で4万環境ステップの訓練が可能である。

実験結果

リサーチクエスチョン

  • RQ1値ベース強化学習エージェントにおいて、ニューラルネットワークの幅とリプレイ比をスケーリングすることで、人間水準のサンプル効率を達成しつつ、超人間レベルの性能を実現できるか?
  • RQ2周期的なネットワークリセットと自己教師型表現学習は、大規模でサンプル制約のある強化学習における、学習の安定性と性能向上にどのように寄与するか?
  • RQ3高いリプレイ比とアーキテクチャのスケーリングは、深層強化学習エージェントの一般化性能を向上させ、性能の停滞を防ぐのにどの程度効果を示すか?
  • RQ4モデルフリー強化学習エージェントは、EfficientZeroといった最先端のモデルベース手法に比べ、サンプル効率と計算コストの両面で優れているか?
  • RQ5自己教師型学習(ピクセルから)は、サンプルが限られた強化学習において、大規模ネットワークと高いリプレイ比と組み合わせることで性能向上をもたらすか?

主な発見

  • BBFは26種類のAtari 100Kゲームにおいて、四分位平均(IQM)の人間正規化スコアが1.0を超えるという、わずか2時間のプレイ時間で超人間レベルの性能を達成した。
  • BBFは、DQN、Rainbow、IQNに比べて少なくとも16倍のサンプル効率向上を達成した。また、最近の強力なベースラインであるSR-SPRに比べても5倍のサンプル効率向上を達成した。
  • 20万環境ステップの時点で、DQNが256時間の訓練を要する最終性能を達成しており、サンプル制約下での急速な学習が確認された。
  • 2000万環境ステップでRainbowの最終性能に到達するが、ハイパーパramータの変更なしに100万ステップで同等の結果を達成した。
  • 5万環境ステップのみで、スタックドアクションを有効にしたBBFは、スタックドアクションなしで10万ステップ訓練された最近のアルゴリズムを上回った。
  • EfficientZeroと比較して、同等の性能を達成しながらも、実行時間を少なくとも4倍短縮した。これは、計算効率の優位性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。