[論文レビュー] ELIGN: Expectation Alignment as a Multi-Agent Intrinsic Reward
本稿では、期待一致に基づくタスクに依存しない内在的報酬であるELIGNを提案する。この報酬は、分散型学習とスパarsな報酬の下でマルチエージェント強化学習を可能にする。動物の群れにおける自己組織化にインspiredされ、ELIGNはエージェントが周囲のエージェントの予測に合致する行動を取ることを促進し、中央集権的トレーニングや密集報酬なしで協調性を向上させる。マルチエージェントパーティクルおよびGoogle Research Football環境において、特に部分観測下で最先端の性能を達成する。
Modern multi-agent reinforcement learning frameworks rely on centralized training and reward shaping to perform well. However, centralized training and dense rewards are not readily available in the real world. Current multi-agent algorithms struggle to learn in the alternative setup of decentralized training or sparse rewards. To address these issues, we propose a self-supervised intrinsic reward ELIGN - expectation alignment - inspired by the self-organization principle in Zoology. Similar to how animals collaborate in a decentralized manner with those in their vicinity, agents trained with expectation alignment learn behaviors that match their neighbors' expectations. This allows the agents to learn collaborative behaviors without any external reward or centralized training. We demonstrate the efficacy of our approach across 6 tasks in the multi-agent particle and the complex Google Research football environments, comparing ELIGN to sparse and curiosity-based intrinsic rewards. When the number of agents increases, ELIGN scales well in all multi-agent tasks except for one where agents have different capabilities. We show that agent coordination improves through expectation alignment because agents learn to divide tasks amongst themselves, break coordination symmetries, and confuse adversaries. These results identify tasks where expectation alignment is a more useful strategy than curiosity-driven exploration for multi-agent coordination, enabling agents to do zero-shot coordination.
研究の動機と目的
- 分散型トレーニングとスパars報酬の下で、中央集権的クライアントや密集報酬形状が利用できない状況におけるマルチエージェント協調の課題に対処すること。
- 外部の監視や完全観測が不可能な状況でも、協調行動を学習できるタスクに依存しない内在的報酬を開発すること。
- エージェントの行動を仲間の期待に合わせることで協調性を向上させ、誤協調や対称性の破壊問題を低減すること。
- 特に多様なエージェント能力を有する複雑な環境において、ゼロショット協調性とスケーラビリティを実現すること。
- 分散型、部分観測環境下で、従来の内在的報酬(例:好奇心)やスパars報酬を上回ること。
提案手法
- ELIGNは、エージェントの行動が周囲のエージェントがその将来の観測について形成する期待とどの程度一致しているかに基づいて内在的報酬を計算する。
- 各エージェントは、局所的観測とワールドモデルに基づいて、仲間の将来の観測を予測し、期待モデル化のための「予測ヘッド」を形成する。
- 内在的報酬は、予測された次回の観測と実際の観測との間の平均二乗誤差の負の値として定義され、仲間の予測の不確実性を低減する行動を促進する。
- この手法は、動物行動学における自己組織化原理に由来する自己教師型学習目的を用いる。エージェントは局所的予測一致を通じて協調する。
- SACベースのマルチエージェント強化学習フレームワークを用い、共有のワールドモデルと個別の方策ネットワークを採用し、分散型でエンドツーエンドに学習する。
- 3つのバリエーションを評価:self-ELIGN(エージェントが自身の将来を予測)、team-ELIGN(エージェントが仲間の将来を予測)、adv-ELIGN(エージェントが敵の将来を予測)。性能に関するアブレーションスタディも実施。
実験結果
リサーチクエスチョン
- RQ1期待一致は、分散型トレーニングとスパars報酬の下で、マルチエージェントRLのための実用的内在的報酬として機能するか?
- RQ2ELIGNは、中央集権的クライアントや密集報酬形状なしで、マルチエージェントタスクにおける協調性を向上させるか?
- RQ3スケーラビリティと性能の観点から、ELIGNは好奇心ベースおよびスパars内在的報酬と比較してどのように差をつけるか?
- RQ4期待一致は、協調性の観点で、好奇心駆動型探索を上回る状況はどのようなものか?
- RQ5ELIGNで学習したエージェントは、スケーリングされた環境や未知の構成においてゼロショット協調性を発揮できるか?
主な発見
- マルチエージェントパーティクルおよびGoogle Research Football環境の6つのタスクのうち5つで、ELIGNはスパars報酬および好奇心ベースの内在的報酬を上回った。特に部分観測および分散型トレーニング下で顕著な性能向上を示した。
- 5エージェントの協調ナビゲーションタスクでは、ELIGN(selfバージョン)が平均外的報酬471.07 ± 5.00を達成し、スパarsベースラインの434.68 ± 6.42を上回った。
- 6エージェントの非一様ナビゲーションタスクでは、ELIGN(teamバージョン)が699.56 ± 11.64を達成し、スパarsベースラインの561.16 ± 31.63を著しく上回った。
- 物理学的かくしんタスクでは、ELIGN(selfバージョン)が248.16 ± 6.62を達成し、スパarsベースラインの128.64 ± 17.31を上回った。これは競合状況下での協調性の向上を示している。
- 予言者対プレイヤーおよびキープアウェイタスクでは、ELIGNはエージェントと敵との距離を短縮し、協調性を向上させた。特にteam-ELIGNバージョンは、予言者対プレイヤーで1.93 ± 0.00のスパarsベースラインに対し、2.04 ± 0.01を達成した。
- ELIGNは強力なゼロショット一般化を示した。ELIGNで学習したエージェントは、スケーリングされた環境において、スパars報酬や好奇心ベースの方法よりも高い性能を発揮した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。