[論文レビュー] Scalable Multi-agent Covering Option Discovery based on Kronecker Graphs
本稿では、個々のエージェントの遷移グラフのクライマー積として連合状態空間を近似するスケーラブルなマルチエージェントオプション発見手法を提案する。これにより、連合カバーイングオプションを構築するためのフィードラーベクトルの効率的推定が可能となり、マルチエージェント強化学習における連合探索が著しく向上する。本手法は、マルチエージェントグリッドマズーやムージョコ環境を含む複雑なタスクにおいて、単一エージェントオプションやベースラインを上回る性能を発揮する。
Covering skill (a.k.a., option) discovery has been developed to improve the exploration of RL in single-agent scenarios with sparse reward signals, through connecting the most distant states in the embedding space provided by the Fiedler vector of the state transition graph. Given that joint state space grows exponentially with the number of agents in multi-agent systems, existing researches still relying on single-agent skill discovery either become prohibitive or fail to directly discover joint skills that improve the connectivity of the joint state space. In this paper, we propose multi-agent skill discovery which enables the ease of decomposition. Our key idea is to approximate the joint state space as a Kronecker graph, based on which we can directly estimate its Fiedler vector using the Laplacian spectrum of individual agents' transition graphs. Further, considering that directly computing the Laplacian spectrum is intractable for tasks with infinite-scale state spaces, we further propose a deep learning extension of our method by estimating eigenfunctions through NN-based representation learning techniques. The evaluation on multi-agent tasks built with simulators like Mujoco, shows that the proposed algorithm can successfully identify multi-agent skills, and significantly outperforms the state-of-the-art. Codes are available at: https://github.itap.purdue.edu/Clan-labs/Scalable_MAOD_via_KP.
研究の動機と目的
- マルチエージェント強化学習(MARL)における報酬の疎らさと状態空間の指数的増大という課題に対処すること。
- 単一エージェントオプションに依存せず、直接的に連合マルチエージェントオプションを発見し、連合状態空間の接続性を向上させること。
- ディープ表現学習を用いて、無限大または大規模な状態空間へスケーリングすること。
- マルチエージェントオプションの分散型および集中型の両方の適用をサポートすること。
提案手法
- 個々のエージェントの遷移グラフのクライマー積として連合状態空間を近似する。
- 理論的結果を活用し、個々のエージェントのグラフのラプラシアン固有値スペクトルを用いて、連合グラフのフィードラーベクトルを推定する。
- 推定されたフィードラーベクトルにおける最小値および最大値に対応する状態を特定することで、代数的接続性を向上させるカバーイングオプションを構築する。
- 連続的または無限大の状態空間に対して、ニューラルネットワークを用いてラプラシアン固有値スペクトルを近似するディープラーニング拡張を導入する。
- 複数の適用戦略をサポートする:分散型、集中型、およびグループベースのマルチエージェントオプション。
- 中央集権的Qラーニング+フォースなどのアルゴリズムを用いて、発見されたオプションを階層的MARLフレームワークに統合する。
実験結果
リサーチクエスチョン
- RQ1クライマー・グラフ近似は、マルチエージェント強化学習における連合マルチエージェントオプションの効率的かつスケーラブルな発見を可能にするか?
- RQ2個々のエージェントの遷移グラフのスペクトルを用いて、連合状態空間のフィードラーベクトルをどれほど正確に推定できるか?
- RQ3マルチエージェントオプションは、報酬が疎なMARLタスクにおいて、単一エージェントオプションと比較して、連合探索とパフォーマンスを著しく向上させるか?
- RQ4ディープラーニング拡張は、連続的または無限状態空間環境へのスケーリングにどの程度効果的か?
- RQ5集中型と分散型のマルチエージェントオプションの採用において、それぞれのパフォーマンス向上はどの程度か?
主な発見
- 6エージェントのグリッドマズータスクでは、ペアワイズマルチエージェントオプションを用いたエージェントが、単一エージェントオプションやオプションなしの状況では失敗したタスクを正常に完了した。
- 集中型トレーニング(中央集権的Qラーニング+フォース)を用いることで、衝突率が高く(最大63%のステップ)、動的な干渉が生じる状況下でも、マルチエージェントオプションを用いたエージェントは安定したパフォーマンスを示した。
- ムージョコタスクでは、提案手法を用いたエージェントが、オプションなしのベースラインおよび単一エージェントオプションを用いたエージェントを上回り、特に複雑な協調環境において顕著な性能向上を示した。
- ディープラーニング拡張により、無限大のスケールを持つ状態空間を有する連続制御タスクにおいても、効果的なオプション発見と適用が可能となり、パフォーマンスの向上が維持された。
- グリッドマズー、グリッドルーム、ムージョコを含む多様な環境において、本手法は顕著なパフォーマンス向上を達成し、最先端のベースラインを一貫して上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。