Skip to main content
QUICK REVIEW

[論文レビュー] Deep Surrogate Assisted Generation of Environments

Varun Bhatt, Bryon Tjanaka|arXiv (Cornell University)|Jun 9, 2022
Advanced Multi-Objective Optimization Algorithms被引用数 11
ひとこと要約

本稿では、新規に生成された環境におけるエージェント行動を予測するために深層アンサンブルモデルを用いる、サンプル効率性に優れた品質多様性(QD)アルゴリズムであるDSAGEを提案する。この手法により、多様で高品質な環境の発見が著しく高速化される。2つのベンチマークドメイン(MazeとMario)において、DSAGEは強化学習および計画エージェントが多様な行動を示す環境を生成する点で、最先端のQD手法を上回る性能を発揮し、アブレーションスタディにより補助的行動データとアーカイブのダウンサンプリングによる性能向上が示された。

ABSTRACT

Recent progress in reinforcement learning (RL) has started producing generally capable agents that can solve a distribution of complex environments. These agents are typically tested on fixed, human-authored environments. On the other hand, quality diversity (QD) optimization has been proven to be an effective component of environment generation algorithms, which can generate collections of high-quality environments that are diverse in the resulting agent behaviors. However, these algorithms require potentially expensive simulations of agents on newly generated environments. We propose Deep Surrogate Assisted Generation of Environments (DSAGE), a sample-efficient QD environment generation algorithm that maintains a deep surrogate model for predicting agent behaviors in new environments. Results in two benchmark domains show that DSAGE significantly outperforms existing QD environment generation algorithms in discovering collections of environments that elicit diverse behaviors of a state-of-the-art RL agent and a planning agent. Our source code and videos are available at https://dsagepaper.github.io/.

研究の動機と目的

  • 環境をまたがる多様なエージェント行動を生成する品質多様性(QD)アルゴリズムの高いサンプルコストを解消すること。
  • 完全シミュレーションを伴わずにエージェントのパフォーマンスを予測する深層アンサンブルモデルを活用することで、環境生成におけるサンプル効率を向上させること。
  • 過去の実行トレースに基づいてエージェント行動を多様化するスケーラブルでインタラクティブなテストセットを可能にすること。
  • アンサンブル支援QDが、異なるドメインにおいて行動的に多様な環境を発見する点で、従来のQD手法を上回ることを示すこと。

提案手法

  • DSAGEは、シミュレートされたエージェントの軌跡を学習した深層アンサンブルモデルを統合し、未観測の新しい環境におけるエージェント行動を予測する。
  • アルゴリズムは、アンサンブルモデルの予測に従って行動空間を探索するQD最適化器(例:CMA-ME)を用いる。
  • アンサンブルモデルが予測したアーカイブから、上位パフォーマンスの候補環境のサブセットをダウンサンプリングにより選別し、完全シミュレーションで評価する。
  • 新たに収集されたシミュレーションデータを用いてアンサンブルモデルをファインチューニングすることで、反復的な改善が可能となり、高価なシミュレーションへの依存度が低下する。
  • パス長さや繰り返し訪問回数などの補助的行動データを活用し、アンサンブルモデルの予測精度と一般化性能を向上させる。
  • 本手法は2つのベンチマークドメインに適用された:ACCEL強化学習エージェントを搭載したMazeドメインと、A*計画エージェントを搭載したMarioドメイン。

実験結果

リサーチクエスチョン

  • RQ1深層アンサンブルモデルは、QD最適化における多様な環境の生成に必要な高価なエージェントシミュレーションの回数を著しく削減できるか?
  • RQ2補助的行動データを統合することで、環境生成におけるアンサンブルモデルの性能はどのように向上するか?
  • RQ3アンサンブルモデルが予測したアーカイブからのダウンサンプリングは、全候補を直接シミュレートするのと比べて、より優れた行動多様性をもたらすか?
  • RQ4DSAGEは、異なるドメインにおいて、最先端のQDアルゴリズムと比較して、多様なエージェント行動を発見する点で優れているか?
  • RQ5アンサンブル支援QDは、急激に変化する行動を示す複雑で確率的な環境へもスケーラブルに適用可能か?

主な発見

  • DSAGEは、MazeおよびMarioの2つのベンチマークドメインにおいて、最先端のQDアルゴリズムを上回り、多様なエージェント行動を効率的に発見した。
  • Mazeドメインでは、迷路の探索度や繰り返し訪問回数といった指標において、より高い行動多様性を達成したが、完全シミュレーションの回数は少ないままだった。
  • Marioドメインでは、DSAGEはジャンプ頻度や敵の倒し方といった多様な行動を引き出すレベルを生成したのに対し、ベースラインのQD手法はその範囲に及ばなかった。
  • アブレーションスタディの結果、補助的行動データの使用とダウンサンプリングにより、アンサンブルモデルの性能が向上し、行動空間のカバー範囲が拡大した。
  • アンサンブルモデルのおかげで、必要な完全シミュレーションの回数が著しく削減され、DSAGEは従来のQDアプローチに比べてはるかに少ないサンプル数で高品質な結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。