Skip to main content
QUICK REVIEW

[論文レビュー] Human-level Atari 200x faster

Steven Kapturowski, Víctor Campos|arXiv (Cornell University)|Sep 15, 2022
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本論文は、780億フレームからわずか4億フレームにまで経験を削減し、200倍のデータ効率を達成するデータ効率の高い強化学習エージェントであるMEMEを紹介している。MEMEは、信頼領域ブートストラップ、正規化された価値関数スケーリング、深層NFNetsベースのアーキテクチャ、およびポリシー distillation を組み合わせることで、多様な環境において安定した学習と高速な学習を実現している。

ABSTRACT

The task of building general agents that perform well over a wide range of tasks has been an important goal in reinforcement learning since its inception. The problem has been subject of research of a large body of work, with performance frequently measured by observing scores over the wide range of environments contained in the Atari 57 benchmark. Agent57 was the first agent to surpass the human benchmark on all 57 games, but this came at the cost of poor data-efficiency, requiring nearly 80 billion frames of experience to achieve. Taking Agent57 as a starting point, we employ a diverse set of strategies to achieve a 200-fold reduction of experience needed to out perform the human baseline. We investigate a range of instabilities and bottlenecks we encountered while reducing the data regime, and propose effective solutions to build a more robust and efficient agent. We also demonstrate competitive performance with high-performing methods such as Muesli and MuZero. The four key components to our approach are (1) an approximate trust region method which enables stable bootstrapping from the online network, (2) a normalisation scheme for the loss and priorities which improves robustness when learning a set of value functions with a wide range of scales, (3) an improved architecture employing techniques from NFNets in order to leverage deeper networks without the need for normalization layers, and (4) a policy distillation method which serves to smooth out the instantaneous greedy policy overtime.

研究の動機と目的

  • 全57種類のアタリゲームでAgent57と同等のパフォーマンスを発揮するが、大幅に高いデータ効率を実現する汎用強化学習エージェントの開発。
  • マルチポリシー・価値関数ベースのエージェントにおいて、経験予算を削減した際に生じる不安定性やボトルネックの解消。
  • Agent57ファミリーの全ポリシーを統合して学習可能であり、高レプレイレシオ、オンラインブートストラップ、および同時学習を安定して実行可能にする。
  • 過去のエージェントが失敗するような困難なゲームでも、パフォーマンスを損なわず、サンプル効率を向上させる。
  • Muesli や MuZero といった最先端手法と同等の性能を示しながらも、優れたデータ効率を実現することの証明。

提案手法

  • オンラインQネットワークからのブートストラップを安定化させるために、近似信頼領域法を採用し、学習中の分布シフトを低減。
  • ポリシー族に含まれる複数の価値関数に広範なスケール差がある状況に対応するため、価値関数損失および優先度の正規化スキームを導入。
  • NFNetsにインspiredされた改良型ニューラルネットワークアーキテクチャを採用し、バッチ正規化層を含まずに深いネットワークを構築可能に。
  • ポリシー蒸留を適用して、時間経過とともにグリーディポリシーを滑らかにし、即時の行動選択による不安定性を低減。
  • Retraceターゲットを置き換え、ウォーキングのQ(λ)のソフトバージョンを採用することで、信号伝播を高速化し、過剰なトレースカットを軽減。
  • 高レプレイレシオと、全ポリシーの遷移を統合して学習することで、データ利用効率とサンプル効率を向上。

実験結果

リサーチクエスチョン

  • RQ1Agent57に比べ200倍の経験削減を達成しつつ、全57種類のアタリゲームで人間水準のパフォーマンスを達成できるか?
  • RQ2マルチポリシー・価値ベースエージェントにおいて、データレジームを縮小した際に生じる不安定性は何か? そして、それらをどのように緩和できるか?
  • RQ3複数の価値関数を同時に学習する際、オンラインネットワークからのブートストラップをどのように安定化できるか?
  • RQ4価値関数のスケールが著しく異なる状況において、損失および優先度の正規化が訓練安定性にどれほど寄与するか?
  • RQ5NFNetsのような深く、正規化を含まないアーキテクチャは、密度の高い報酬と多様な環境を有する強化学習設定で、データ効率を向上させられるか?

主な発見

  • MEMEは、4億フレームの経験のみで全57種類のアタリゲームで人間水準のパフォーマンスを達成—Agent57の780億フレームに比べ200倍の効率。
  • モンテズマのレヴァンチやピットファールなど、特に難しい環境でも、人間のベンチマークを大幅に下回るデータ量で上回る。
  • 平均的に、MEMEは100億フレームで全ゲームの95%のヒューマン正規化スコアに到達するが、Agent57は780億フレームを要する。
  • Muesli や MuZero と同等の性能を示し、データ効率の向上が最終パフォーマンスの低下を招かないことを実証。
  • 信頼領域更新、価値正規化、ポリシー蒸留の組み合わせにより、高レプレイレシオおよびオンラインブートストラップ下でも安定した学習が可能。
  • アステロイドスやMs.パックマンでは、100億フレーム以内に30万点以上、2万7千点以上を達成し、優れた一般化性能とサンプル効率を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。