Skip to main content
QUICK REVIEW

[論文レビュー] Arena: A General Evaluation Platform and Building Toolkit for Multi-Agent Intelligence

Yuhang Song, Andrzej Wojcicki|arXiv (Cornell University)|May 17, 2019
Reinforcement Learning in Robotics参考文献 96被引用数 8
ひとこと要約

Arenaは、35種類の多様なゲームと、GUIで設定可能な社会的木構造、および5つの基本的マルチエージェント報酬スキーム(BMaRSs)を備えた、多エージェント知能のための汎用的評価プラットフォームおよび構築キットです。研究者が新しいマルチエージェントシナリオを構築でき、最先端のディープマルチエージェント強化学習ベースラインをサポートし、全ゲームで標準化されたパフォーマンス評価が可能な100の事前学習済みエージェント/チームを提供します。

ABSTRACT

Learning agents that are not only capable of taking tests, but also innovating is becoming a hot topic in AI. One of the most promising paths towards this vision is multi-agent learning, where agents act as the environment for each other, and improving each agent means proposing new problems for others. However, existing evaluation platforms are either not compatible with multi-agent settings, or limited to a specific game. That is, there is not yet a general evaluation platform for research on multi-agent intelligence. To this end, we introduce Arena, a general evaluation platform for multi-agent intelligence with 35 games of diverse logics and representations. Furthermore, multi-agent intelligence is still at the stage where many problems remain unexplored. Therefore, we provide a building toolkit for researchers to easily invent and build novel multi-agent problems from the provided game set based on a GUI-configurable social tree and five basic multi-agent reward schemes. Finally, we provide Python implementations of five state-of-the-art deep multi-agent reinforcement learning baselines. Along with the baseline implementations, we release a set of 100 best agents/teams that we can train with different training schemes for each game, as the base for evaluating agents with population performance. As such, the research community can perform comparisons under a stable and uniform standard. All the implementations and accompanied tutorials have been open-sourced for the community at https://sites.google.com/view/arena-unity/.

研究の動機と目的

  • 現在、ゲーム固有またはスケーラブルでないソリューションに依存している多エージェント知能のための汎用的評価プラットフォームの欠如に対処すること。
  • GUIで設定可能な社会的木構造と5つの基本的マルチエージェント報酬スキーム(BMaRSs)を用いて、研究者が簡単に新規のマルチエージェント問題を考案・構築できるようにすること。
  • 35のゲームそれぞれについて、異なるスキームで学習された100の最良パフォーマンスを示すエージェント/チームを公開することで、標準化されたベンチマークを提供すること。
  • 最先端のベースラインのオープンソース実装を通じて、新しいマルチエージェント強化学習アルゴリズムの開発を支援すること。
  • 移動や衝突といった基本的行動のための即時利用可能な密度の高い報酬関数を提供することで、低レベルのスキル工学の負担を軽減すること。

提案手法

  • プラットフォームは、階層的なエージェント関係を定義できるGUIで設定可能な社会的木構造を導入し、チーム構造や社会的ダイナミクスの柔軟なモデリングを可能にします。
  • 5つの基本的マルチエージェント報酬スキーム(BMaRSs)は報酬関数への制限として定義され、それぞれが異なる社会的パラダイム(例:競争、協力、階層)に対応します。
  • 各BMaRSには、複雑な社会的相互作用の構築を簡素化するだけでなく、検証メカニズムにより正しさを保証する、複数の即時利用可能な報酬関数が含まれます。
  • プラットフォームは、低レベルのエージェント行動(例:移動、衝突、エネルギー管理)のための事前実装済み密度の高い報酬関数を提供し、高レベルのマルチエージェント研究の加速を図ります。
  • Unityと統合されており、アルゴリズム開発および評価のための5つの最先端のディープマルチエージェント強化学習ベースラインのPython実装も提供します。
  • 視覚的・RAM表現、チームデスマッチ・キャプチャ・ザ・フラッグ・サバイバルなどのメカニズム、リアルタイム・離散的/連続的ダイナミクスを備えた、包括的な35のゲームのセットにより、広範な評価範囲が可能になります。

実験結果

リサーチクエスチョン

  • RQ1多エージェント知能のための汎用的評価プラットフォームは、どのように設計すれば、多様なゲームメカニズムと社会的構造をサポートできるでしょうか?
  • RQ2GUIで設定可能な社会的木構造と事前に定義された報酬スキーム(BMaRSs)は、研究者がどれほど迅速に新規のマルチエージェントシナリオをプロトタイプ化できるでしょうか?
  • RQ31ゲームあたり100の事前学習済みエージェント/チームを備えた標準化されたベンチマークは、異なる学習スキーム間で安定的かつ比較可能なパフォーマンス評価を保証できるでしょうか?
  • RQ4提供されたディープマルチエージェント強化学習ベースラインは、Arenaの35の多様なゲームにおいて、どれほど高いパフォーマンスを達成できるでしょうか?
  • RQ5このプラットフォームは、未開拓のマルチエージェント知能問題を探索する研究者にとって、どれほど入り込みやすくなるでしょうか?

主な発見

  • Arenaは、多様な論理、表現(視覚的/RAM)、メカニズムを備えた35のマルチエージェントゲームの包括的セットを提供し、マルチエージェントシステムの広範な評価を可能にします。
  • プラットフォームのGUIで設定可能な社会的木構造と5つのBMaRSsにより、研究者はチームベースの競争や階層的協力といった複雑な社会的構造を簡単に定義・実験できます。
  • 各BMaRSには、意図した社会的パラダイムを正しく生成することを検証済みの複数の即時利用可能な報酬関数が含まれており、正しさが保証され、実装エラーが低減されます。
  • プラットフォームには、異なるスキームで学習された100のエージェント/チームが事前学習済みとして含まれており、パフォーマンス比較のための安定的で均一なベースラインを提供します。
  • 5つの最先端のディープマルチエージェント強化学習ベースラインのオープンソース実装により、新規アルゴリズムの迅速なプロトタイピングと検証が可能になります。
  • 移動、エネルギーコスト、衝突などの基本的行動のための密度の高い統合報酬関数のおかげで、研究者が高レベルのマルチエージェント戦略に集中できるよう、工学的負担が顕著に軽減されます。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。