Skip to main content
QUICK REVIEW

[論文レビュー] Let's Play Again: Variability of Deep Reinforcement Learning Agents in Atari Environments

Kaleigh Clary, Emma Tosch|arXiv (Cornell University)|Apr 12, 2019
Reinforcement Learning in Robotics参考文献 5被引用数 16
ひとこと要約

この論文は、同じハイパーパrameterとランダムシードで訓練された際でも、Atari環境における深層強化学習エージェントが顕著な性能変動を示すことを示しており、モデル評価に平均値や最大報酬といった単一の推定値を用いることの妥当性に疑問を呈している。著者らは、複数のテストエピソードにおけるスコアの分布としてエージェントの性能を報告することを提唱し、これにより真のモデル挙動をより良く捉えられ、モデル選択におけるバイアスを低減できることを主張している。

ABSTRACT

Reproducibility in reinforcement learning is challenging: uncontrolled stochasticity from many sources, such as the learning algorithm, the learned policy, and the environment itself have led researchers to report the performance of learned agents using aggregate metrics of performance over multiple random seeds for a single environment. Unfortunately, there are still pernicious sources of variability in reinforcement learning agents that make reporting common summary statistics an unsound metric for performance. Our experiments demonstrate the variability of common agents used in the popular OpenAI Baselines repository. We make the case for reporting post-training agent performance as a distribution, rather than a point estimate.

研究の動機と目的

  • 同じハイパーパrameterとランダムシードで訓練された深層強化学習エージェントがAtari環境においてどの程度の性能変動を示すかを調査すること。
  • 平均値や最大報酬といった単一の推定値を用いてエージェント性能を要約するという一般的な慣習に疑問を呈すること。
  • エージェント性能のばらつきがランダムシードの違いによるものに限らないこと、むしろ個々の訓練済みモデル固有のものであることを実証すること。
  • 再現性と公平性を高めるために、モデル選択の評価慣行を点推定値ではなくスコアの分布に移行すべきだと主張すること。
  • 性能分布が多峰的、肥尾的、または著しく変動する場合に、モデル選択のための統計的指針を提示すること。

提案手法

  • 同じ訓練済みポリシーを用いて、異なるランダムシードで複数のテストエピソード(例:100エピソード)から性能スコアを収集した。
  • 各シード付きモデルのスコア分布を分析し、モデル内でのばらつき(多峰性、肥尾、歪度など)を評価した。
  • ヒストограмなどの可視化手法を用いて、Q*bert、Breakout、Space InvadersなどのAtariゲームにおいて、異なるランダムシードやアルゴリズム(例:A2C、PPO2、DQN)の性能分布を比較した。
  • 平均値や最大スコアに基づくモデル選択といった一般的なモデル選択手法が、固有の性能ばらつきによって生じるバイアスにどの程度影響を受けるかを評価した。
  • 複数比較を補正するため、リサンプリング、ボンフェローニ補正、スコアのパーティションにわたる交差検証などの統計的補正手法を提案した。
  • 分布が正規分布でない、または多峰的である場合に特に、要約統計量ではなくスコアの完全な分布を報告することで、性能をより的確に表現することを提唱した。

実験結果

リサーチクエスチョン

  • RQ1同じハイパーパrameterとランダムシードで訓練された深層強化学習エージェントが、Atari環境のテストエピソード間でどの程度の性能変動を示すか?
  • RQ2性能分布が多峰的または肥尾的である場合、平均値や最大スコアに基づくモデル選択がどのようなバイアスを生じるか?
  • RQ3性能分布が良好に定義されていない場合、点推定値(例:平均 ± 標準誤差)を報告することにどのような影響があるか?
  • RQ4モデル内での性能ばらつきが、深層強化学習におけるモデル評価の再現性と公平性にどのように影響するか?
  • RQ5複数のシード付きエージェントからモデルを選択する際、ばらつきを補正するのに適した統計的手法は何か?

主な発見

  • 同じランダムシードで訓練された深層強化学習エージェントは、Atari環境においてもテストエピソード間で顕著な性能変動を示し、スコア分布が著しく異なることが判明した。
  • Q*bertにおけるA2Cの性能分布は二峰的であり、平均値は2425.4 ± 53.8であったが、中央部の密度が低いため、この平均値は代表的ではないことが判明し、平均値が誤解を招く要約統計量であることが示された。
  • BreakoutにおけるPPO2の性能分布は肥尾的であり、平均値209.3 ± 3.2は極端なスコアが平均に大きく影響を与えるため、比較のための信頼性の低い指標であった。
  • すべてのシード付きモデルを統合したSpace Invadersの性能は二峰的であったため、シードごとのモデル挙動が一貫しておらず、モデル内でのばらつきが全体のトレンドを隠蔽または歪めることを示唆した。
  • 最大スコアに基づくモデル選択は、分散が大きいモデルを好む傾向があり、期待性能がより高いモデルよりも高い分散を持つモデルが優遇されるため、モデル選択に顕著なバイアスを生じる。
  • 複数のテストエピソードにおけるスコアの分布として性能を報告することは、点推定値に依存するよりも情報量が多く信頼性が高く、特に分布が正規分布でない、または多峰的な場合に顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。