Skip to main content
QUICK REVIEW

[論文レビュー] Measuring Sample Efficiency and Generalization in Reinforcement Learning Benchmarks: NeurIPS 2020 Procgen Benchmark

Sharada P. Mohanty, Jyotish Poonganam|arXiv (Cornell University)|Mar 29, 2021
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本論文は、16の手続き的生成環境を用いて強化学習におけるサンプル効率性と一般化性能を評価するための中央集権的ベンチマークであるNeurIPS 2020 Procgen コンペティションを提示する。数千件の提出物におけるエンドツーエンドの訓練と評価を標準化することで、高い一般化性能とサンプル効率性を達成するトップの手法が同定され、ハイパーパrameterチューニング、データ拡張、MaxBlurPool やチャネルワイド注釈のアーキテクチャ変更といった重要な改善が得られた。

ABSTRACT

The NeurIPS 2020 Procgen Competition was designed as a centralized benchmark with clearly defined tasks for measuring Sample Efficiency and Generalization in Reinforcement Learning. Generalization remains one of the most fundamental challenges in deep reinforcement learning, and yet we do not have enough benchmarks to measure the progress of the community on Generalization in Reinforcement Learning. We present the design of a centralized benchmark for Reinforcement Learning which can help measure Sample Efficiency and Generalization in Reinforcement Learning by doing end to end evaluation of the training and rollout phases of thousands of user submitted code bases in a scalable way. We designed the benchmark on top of the already existing Procgen Benchmark by defining clear tasks and standardizing the end to end evaluation setups. The design aims to maximize the flexibility available for researchers who wish to design future iterations of such benchmarks, and yet imposes necessary practical constraints to allow for a system like this to scale. This paper presents the competition setup and the details and analysis of the top solutions identified through this setup in context of 2020 iteration of the competition at NeurIPS.

研究の動機と目的

  • 深層強化学習におけるサンプル効率性と一般化性能を測定するスケーラブルで中央集権的なベンチマークを確立すること。
  • 多様で手続き的に生成された環境において、エージェントが未知のレイアウトや設定に直面する状況での一般化を分離し、評価すること。
  • 標準化され、再現可能なかたちで数千件のユーザーフォームRLコードベースをエンドツーエンドで評価可能にする仕組みを提供すること。
  • サンプル効率性と一般化性能を向上させるための主要な手法的実践を同定すること。
  • 最大の柔軟性と実用的なスケーラビリティを備えた、将来のベンチマークの反復改善の基盤を提供すること。

提案手法

  • 手続き的に生成された環境、ランダムなレベルレイアウト、アセット、難易度を備えたオープンソースのProcgenベンチマークに基づく。
  • 最終評価のための4つのホールドアウトテスト環境を定義し、未観測の手続き的バリエーションへの一般化を保証した。
  • 主な指標として平均正規化報酬を用いた:$ R_{norm} = (R - R_{min}) / (R_{max} - R_{min}) $、0から1の値を保証する。
  • 提出物間での公平な比較とスケーラビリティを確保するため、訓練および評価パイプラインを標準化した。
  • MaxPoolをMaxBlurPoolに置き換え、残差ブロックにチャネルワイド注釈モジュールを追加するなどのアーキテクチャ変更を適用した。
  • データ拡張、報酬正規化、補助タスクの影響を、パフォーマンスおよびサンプル効率性の観点から評価した。

実験結果

リサーチクエスチョン

  • RQ1手続き的に生成された環境において、強化学習における一般化性能を最も顕著に向上させる手法的実践は何か?
  • RQ2ハイパーパrameterチューニング、データ拡張、ネットワークアーキテクチャの変更が、サンプル効率性およびパフォーマンスに与える影響は何か?
  • RQ3補助タスクや内生的報酬は、このベンチマークにおける学習効率性および一般化性能にどの程度向上効果をもたらすか?
  • RQ4報酬正規化は、方策学習の安定性および最終的なパフォーマンスにどのような影響を及えるか?
  • RQ5強化学習エージェントにおいて、アーキテクチャの複雑さ、パラメータ数、一般化パフォーマンスの間にはどのようなトレードオフがあるか?

主な発見

  • ハイパーパrameterチューニングは、大多数の提出物においてパフォーマンスを顕著に向上させ、高性能を達成する上で不可欠であることが示された。
  • データ拡張は一般化性能を向上させたが、バランスの取れた適用が不可欠であった。PPGにおける方策の安定性を維持するため、一部の非拡張フレームを保持することが重要であった。
  • MaxPoolをMaxBlurPoolに置き換え、チャネルワイド注釈を追加することで、パrameter数を75%削減しながらパフォーマンスが向上し、アーキテクチャの効率性向上が実証された。
  • 報酬正規化は、学習の安定性および最終的な報酬に顕著なプラスの影響を及ぼし、特に価値ネットワークの学習において顕著であった。
  • 内生的報酬や補助タスク(例:コントラスト学習やdeepMDP)は、計算負荷の増加と訓練ステップ数の減少により、パフォーマンスを低下させた。
  • 再帰的ネットワークやノイズ付きネットワークはパフォーマンスを向上させず、しばしば訓練を遅くしたが、フレームスタックは時系列モデリングにおいてより効果的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。