Skip to main content
QUICK REVIEW

[論文レビュー] Any-Play: An Intrinsic Augmentation for Zero-Shot Coordination

Keane Lucas, Ross Allen|arXiv (Cornell University)|Jan 28, 2022
Explainable Artificial Intelligence (XAI)被引用数 4
ひとこと要約

本稿では、自己対戦で学習したエージェントが、アルゴリズム的に異なる多様なエージェントとゼロショット連携を達成できるようにする、内在的報酬に基づく拡張手法であるAny-Playを紹介する。訓練中に行動の多様性を促進することで、Any-Playはハナビという環境において、アルゴリズム的に異なるエージェントとの間で、これまでにない一般化性能を達成し、最先端の結果をもたらした。

ABSTRACT

Cooperative artificial intelligence with human or superhuman proficiency in collaborative tasks stands at the frontier of machine learning research. Prior work has tended to evaluate cooperative AI performance under the restrictive paradigms of self-play (teams composed of agents trained together) and cross-play (teams of agents trained independently but using the same algorithm). Recent work has indicated that AI optimized for these narrow settings may make for undesirable collaborators in the real-world. We formalize an alternative criteria for evaluating cooperative AI, referred to as inter-algorithm cross-play, where agents are evaluated on teaming performance with all other agents within an experiment pool with no assumption of algorithmic similarities between agents. We show that existing state-of-the-art cooperative AI algorithms, such as Other-Play and Off-Belief Learning, under-perform in this paradigm. We propose the Any-Play learning augmentation -- a multi-agent extension of diversity-based intrinsic rewards for zero-shot coordination (ZSC) -- for generalizing self-play-based algorithms to the inter-algorithm cross-play setting. We apply the Any-Play learning augmentation to the Simplified Action Decoder (SAD) and demonstrate state-of-the-art performance in the collaborative card game Hanabi.

研究の動機と目的

  • 異なるアルゴリズムで訓練されたエージェントと協働する際、既存の協調的AI手法が性能を発揮できないという限界に対処すること。
  • エージェントが訓練済みのアルゴリズムの類似性に関係なく、プール内の他のすべてのエージェントとテストされるという、新しい評価パラダイム「アルゴリズム間クロスプレイ」を形式化すること。
  • 自己対戦ベースのエージェントが、より広範な設定において強力なゼロショット連携性能を達成できるよう、汎用的な拡張手法を開発すること。
  • 挑戦的な協調的環境、すなわちトランプゲームのハナビにおいて、この手法の有効性を示すこと。

提案手法

  • Any-Play手法は、自己対戦訓練中にエージェントが多様な行動を探索するのを促すマルチエージェント内在的報酬を導入する。
  • 内在的報酬は、エージェントの行動または方策の埋め込みの類似度を用いて、チーム内の行動の多様性を測定することで計算される。
  • 報酬は、Simplified Action Decoder (SAD) などの自己対戦アルゴリズムの学習目的に統合され、重複のない戦略の探索を促進する。
  • この手法により、異なるアルゴリズムで訓練された相手に対しても、頑健で一般化可能な方策を学習するエージェントが得られる。
  • 相互作用の多様性に焦点を当てた、マルチエージェント設定への既存の内在的報酬フレームワークの拡張である。
  • ベースとなるアルゴリズムのアーキテクチャを変更する必要がなく、既存の自己対戦手法に即座に統合可能なプラグイン拡張手法である。

実験結果

リサーチクエスチョン

  • RQ1異なるアルゴリズムで訓練されたエージェントとペairedした場合、自己対戦で学習したエージェントが強力なゼロショット連携性能を達成できるか?
  • RQ2訓練中の行動の多様性が、アルゴリズム的に異なる未知のチームメイトに対する一般化にどのように影響するか?
  • RQ3標準的な自己対戦および他の内在的報酬ベースラインと比較して、Any-Playの内在的報酬はどの程度連携性能を向上させるか?
  • RQ4Any-Playは、ハナビのようなゼロショット連携タスクで最先端のパフォーマンスを達成できるか?
  • RQ5この手法は、アーキテクチャの変更なしに、既存の自己対戦アルゴリズムに効果的に適用可能か?

主な発見

  • Any-Playは、アルゴリズム間クロスプレイにおけるゼロショット連携性能を顕著に向上させ、Other-Play や Off-Belief Learning などのベースライン手法を上回った。
  • Simplified Action Decoder (SAD) に適用した場合、Any-Playはゼロショット連携設定下でハナビにおいて最先端のパフォーマンスを達成した。
  • Any-Playで訓練されたエージェントは、訓練時に明示的にモデル化されていなくても、異なるアルゴリズムで訓練されたチームメイトに対して強い一般化性能を示した。
  • 内在的多様性報酬により、より効果的で多様な連携戦略が得られ、多様なチームメイトの組み合わせにおいて、高いチームスコアが達成された。
  • この手法は、ベースとなる学習アルゴリズムの変更なしに性能向上を維持しており、モジュラリティと広範な適用可能性を確認した。
  • 実験的結果から、Any-PlayによりSADは、多様なチームメイトとペaired場合に近似的に最適なパフォーマンスを達成でき、実世界の協調的シナリオにおける有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。