Skip to main content
QUICK REVIEW

[論文レビュー] Discovering Diverse Multi-Agent Strategic Behavior via Reward Randomization

Zhenggang Tang, Chao Yu|arXiv (Cornell University)|Jan 1, 2021
Reinforcement Learning in Robotics参考文献 65被引用数 13
ひとこと要約

本稿では、報酬構造を摂動することで、ポリシー勾配アルゴリズムが多エージェントゲームにおいて多様で高報酬のナッシュ均衡——特に到達が難しい協力戦略——を発見できるようにする、報酬ランダマイゼーション(RR)という手法を紹介する。提案された報酬ランダマイゼーテッド・ポリシー勾配(RPG)アルゴリズムは、スタッグ・フック、モンスターハンティング、アガーライクといった複雑なゲームで、人間が解釈可能な複数の戦略を発見し、相手のタイプに応じて動的に反応できる適応的エージェントを実現し、ファインチューニングや相手モデル化によって優れた報酬を達成する。

ABSTRACT

We propose a simple, general and effective technique, Reward Randomization for discovering diverse strategic policies in complex multi-agent games. Combining reward randomization and policy gradient, we derive a new algorithm, Reward-Randomized Policy Gradient (RPG). RPG is able to discover multiple distinctive human-interpretable strategies in challenging temporal trust dilemmas, including grid-world games and a real-world game Agar.io, where multiple equilibria exist but standard multi-agent policy gradient algorithms always converge to a fixed one with a sub-optimal payoff for every player even using state-of-the-art exploration techniques. Furthermore, with the set of diverse strategies from RPG, we can (1) achieve higher payoffs by fine-tuning the best policy from the set; and (2) obtain an adaptive agent by using this set of strategies as its training opponents. The source code and example videos can be found in our website: https://sites.google.com/view/staghuntrpg.

研究の動機と目的

  • 複数のナッシュ均衡を有するゲームにおいて、標準的なマルチエージェントポリシー勾配(PG)アルゴリズムが一貫して最適でない均衡に収束するという限界に対処すること。
  • 標準的なPG手法が狭い収束領域のため到達できない、高報酬で人間が解釈可能な戦略的行動——特に協力的均衡——を発見すること。
  • 複雑な探索ヒューリスティクスに依存せずに、マルチエージェントマルコフゲームにおける多様な戦略モードを探索する一般的で効果的な手法を開発すること。
  • 発見された多様な戦略のセットに対して学習させることで、相手の行動に応じて動的に戦略を変更できる適応的エージェントの構築を可能にすること。
  • 報酬ランダマイゼーションの有効性を、アガーライク などの現実世界や複雑な環境において実証すること。ここでは、発生する行動の多様性と戦略的多様性が重要である。

提案手法

  • 報酬ランダマイゼーション(RR)は、マルチエージェントゲームの報酬関数に対して、報酬ベクトルにランダムなノイズを加えることで、ポリシー空間内の戦略モードのランドスケープを効果的に変化させる。
  • この手法はポリシー勾配学習と統合され、報酬をランダマイズした状態でポリシーを学習する新しいアルゴリズム、報酬ランダマイゼーテッド・ポリシー勾配(RPG)を形成する。
  • RRは事前学習フェーズで適用され、複数回のランダム報酬摂動に対して、協力的および競争的行動を含む一連の明確に異なる戦略の集合を発見する。
  • 多様な戦略の集合を発見した後、本手法は2つの主要な応用を可能にする:(1) 発見された戦略集合から報酬が最も高いポリシーをファインチューニングしてさらなる報酬向上を図ること、(2) 発見された戦略集合に対して適応的ポリシーを学習させ、動的戦略切り替えを可能にすること。
  • 報酬摂動により、高報酬で低確率の均衡——スタッグ・フックにおけるリスクを伴う協力——が勾配ベース最適化に対してよりアクセスしやすくなるという事実を活用している。
  • 本手法は、3つの環境で評価された:反復的スタッグ・フック、モンスターハンティング、アガーライク。標準PGおよび最先端の探索技術とのアブレーションと比較が行われた。

実験結果

リサーチクエスチョン

  • RQ1標準的なポリシー勾配手法が収束できない複雑なマルチエージェントゲームにおいて、報酬ランダマイゼーションは、高報酬で協力的な均衡を効果的に発見できるか?
  • RQ2報酬ランダマイゼーションは、伝統的なポリシー空間およびアクション空間探索手法と比較して、複雑なマルコフゲームにおける多様な戦略的行動を発見する上で、どのように優れているか?
  • RQ3発見された多様な戦略セットを用いて、相手のタイプに応じて行動を動的に調整できる適応的エージェントを訓練できる程度はどの程度か?
  • RQ4RPGは、アガーライク などの現実世界のゲームを含む、さまざまなゲーム環境において、人間が解釈可能な非自明な出現戦略を一貫して発見できるか?
  • RQ5発見された戦略セットを用いて、ゼロショット設定下でファインチューニングや相手モデル化によりパフォーマンスを向上させることができるか?

主な発見

  • 反復的スタッグ・フックでは、RPGは高報酬の協力的および競争的行動を含む多様な戦略を発見したが、標準PGは一貫して最適でない非協力的均衡に収束した。
  • RPGで発見された戦略セットに対して学習した適応的ポリシーは、Tit-for-Tat や ランダムエージェント を含む4つの手作業で設計された相手に対して高いパフォーマンスを示し、強固な動的適応性を示した。
  • モンスターハンティングでは、適応的ポリシーは協力的相手には協力し、競争的相手には回避または搾取する行動を学習したことが、適応訓練曲線の安定した頻度パターンから明らかになった。
  • アガーライクでは、適応的ポリシーは協力的パートナーと協力し、競争的パートナーに搾取されないよう学習した。攻撃頻度は初期に低下し、協力頻度は時間経過とともに増加した。
  • RPGアルゴリズムは、アガーライクで非自明な出現行動——協力的グループアタックや戦略的回避——を複数発見したが、標準PGでは同様の行動は得られなかった。
  • RPGで発見された戦略集合から報酬が最も高いポリシーをファインチューニングした結果、標準PGが達成した報酬よりも顕著に高い報酬が得られた。戦略発見における多様性の価値を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。