Skip to main content
QUICK REVIEW

[論文レビュー] SHAQ: Incorporating Shapley Value Theory into Multi-Agent Q-Learning

Jianhong Wang, Yuan Zhang|arXiv (Cornell University)|May 31, 2021
Reinforcement Learning in Robotics参考文献 45被引用数 9
ひとこと要約

本稿では、グローバルリワードゲームにおける価値因子化にシャープレー値理論を統合した、マルチエージェント強化学習アルゴリズムSHAQを提案する。マルコフシャープレー値(MSV)とシャープレー・ベルマン最適性方程式(SBOE)を導入することで、理論的根拠に基づく責任割り当てを実現し、協調的MARL設定において高い性能と解釈可能性を両立する。

ABSTRACT

Value factorisation is a useful technique for multi-agent reinforcement learning (MARL) in global reward game, however its underlying mechanism is not yet fully understood. This paper studies a theoretical framework for value factorisation with interpretability via Shapley value theory. We generalise Shapley value to Markov convex game called Markov Shapley value (MSV) and apply it as a value factorisation method in global reward game, which is obtained by the equivalence between the two games. Based on the properties of MSV, we derive Shapley-Bellman optimality equation (SBOE) to evaluate the optimal MSV, which corresponds to an optimal joint deterministic policy. Furthermore, we propose Shapley-Bellman operator (SBO) that is proved to solve SBOE. With a stochastic approximation and some transformations, a new MARL algorithm called Shapley Q-learning (SHAQ) is established, the implementation of which is guided by the theoretical results of SBO and MSV. We also discuss the relationship between SHAQ and relevant value factorisation methods. In the experiments, SHAQ exhibits not only superior performances on all tasks but also the interpretability that agrees with the theoretical analysis. The implementation of this paper is on https://github.com/hsvgbkhgbv/shapley-q-learning.

研究の動機と目的

  • マルチエージェント強化学習(MARL)における価値因子化手法の理論的解釈可能性の欠如に対処すること。
  • マルコフ凸ゲームの概念を通じて、動的でマルコフ的環境に対する協力的ゲーム理論フレームワークを形式化すること。
  • 協力的MARLにおけるシャープレー値を用いた理論的に妥当な責任割り当てメカニズムを導出することにより、効率性、対称性、ダミーエージェント同定可能性を確保すること。
  • 収束性と解釈可能性を両立し、分散実行が可能な新たなMARLアルゴリズム、シャープレーQ学習(SHAQ)を構築すること。
  • 提案手法が、性能面で最先端のベースラインを上回るとともに、透明で理論的根拠に基づいた責任割り当てを提供することを検証すること。

提案手法

  • グランドコалиション下でのコア安定性を保証するように、マルコフ凸ゲームへのシャープレー値の一般化としてマルコフシャープレー値(MSV)を導入する。
  • 共同決定的方策下での最適MSVを特徴付けるために、ベルマン方程式の拡張であるシャープレー・ベルマン最適性方程式(SBOE)を導出する。
  • SBOEへの収束を保証するシャープレー・ベルマン作用素(SBO)を提案し、その収束性を証明することで、最適値の安定学習を可能にする。
  • SBOの確率的近似とアーキテクチャ変換を用いて、分散実行を可能にしつつ収束性を維持するSHAQを構築する。
  • 実装上でのシャープレー値の近似を可能にするために、ハイパーネットワークを用いたアテンションベースの重み付け機構を導入し、理論的性質と整合性を保つ。
  • コалиション構造のサンプリング戦略を用いて限界寄与度を推定し、安定な価値因子化を実現するための単調関数を用いてアテンション重みをスケーリングする。

実験結果

リサーチクエスチョン

  • RQ1シャープレー値理論を動的でマルコフ的協力的ゲームに拡張することで、理論的根拠に基づく価値因子化手法を提供できるか?
  • RQ2提案されたマルコフシャープレー値(MSV)は、協力的MARLにおいて、効率性、対称性、ダミーエージェント同定可能性といった重要な公理を満たすか?
  • RQ3シャープレー・ベルマン最適性方程式(SBOE)と関連するシャープレー・ベルマン作用素(SBO)を用いて、収束性と分散実行を両立するMARLアルゴリズムを導出できるか?
  • RQ4得られたSHAQアルゴリズムは、グローバルリワードゲームにおいて、既存の価値因子化手法と比較して優れた性能と解釈可能性を達成できるか?
  • RQ5SHAQにおける責任割り当ては、理論的根拠と実証的にエージェントの貢献度と整合しているか?

主な発見

  • SHAQは、捕食者・獲物およびマルチエージェントスターフィックのベンチマークを含め、全評価タスクで優れた性能を達成し、最先端のベースラインを上回る。
  • SHAQの責任割り当ては解釈可能であり、理論的性質と整合する:ダミーエージェントが正しく同定され、効率性が確保され、限界寄与度が適切に反映される。
  • シャープレー・ベルマン作用素(SBO)が最適SBOEに収束することが証明され、学習プロセスの理論的安定性と正しさが保証される。
  • SBOとMSVフレームワークの理論的保証のおかげで、SHAQは分散実行下でも収束性と性能を維持する。
  • SHAQにおけるアテンション重みの実装により、エージェント間の重みの合計が常に1以下になることが保証され、価値因子化の一貫性が維持される。
  • 実証的結果から、SHAQにおけるアテンション重みが実際のエージェント貢献度を反映しており、最適な共同方策と整合する行動に高い重みが割り当てられていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。