Skip to main content
QUICK REVIEW

[論文レビュー] Breaking the Curse of Many Agents: Provable Mean Embedding Q-Iteration for Mean-Field Reinforcement Learning

Lingxiao Wang, Zhuoran Yang|arXiv (Cornell University)|Jun 21, 2020
Evolutionary Algorithms and Applications被引用数 6
ひとこと要約

本稿では、連続的な平均場状態上の価値関数を近似するためにカーネル平均埋め込みを用いる、モデルフリーな平均場強化学習アルゴリズムMF-FQIを提案する。非漸近的収束レートを確立し、MF-FQIが多数のエージェントによる「次元の呪い」を線形にスケーリングすることで克服し、統計的精度において「多数のエージェントの賛美」を享受することを示した。

ABSTRACT

Multi-agent reinforcement learning (MARL) achieves significant empirical successes. However, MARL suffers from the curse of many agents. In this paper, we exploit the symmetry of agents in MARL. In the most generic form, we study a mean-field MARL problem. Such a mean-field MARL is defined on mean-field states, which are distributions that are supported on continuous space. Based on the mean embedding of the distributions, we propose MF-FQI algorithm that solves the mean-field MARL and establishes a non-asymptotic analysis for MF-FQI algorithm. We highlight that MF-FQI algorithm enjoys a "blessing of many agents" property in the sense that a larger number of observed agents improves the performance of MF-FQI algorithm.

研究の動機と目的

  • 多数のエージェントに起因する「多数のエージェントの呪い」に起因する、マルチエージェント強化学習(MARL)における高次元な状態行動空間の課題に対処すること。
  • 連続的エージェント状態空間を持つ平均場MARLのためのモデルフリーなアルゴリズムを開発し、価値関数を無限次元の分布上の汎関数として扱うこと。
  • 提案されたアルゴリズムの非漸近的計算的および統計的収束レートを確立すること。
  • 再生核ヒルベルト空間(RKHS)におけるカーネル平均埋め込みを用いて、同質なエージェント系における対称性と交換可能性を活用すること。
  • 観測エージェント数の増加が統計的精度を向上させることを示し、「多数のエージェントの賛美」効果を導入すること。

提案手法

  • 連続状態空間S上の確率分布として平均場状態を表現し、それを再生核ヒルベルト空間(RKHS)にカーネル平均埋め込みで写像する。
  • 平均場状態の平均埋め込みを用いて、RKHS内での非線形汎関数としてQ関数を近似する。
  • バッチ遷移とカーネルベースの関数近似を用いてQ関数推定値を反復的に改善する、適合Q反復(Fitted Q-iteration)の変種であるMF-FQIアルゴリズムを提案する。
  • Q関数を学習するためにRKHS内での正則化最小二乗推定器を用い、一般化誤差を制御するためのスペクトル正則化項を導入する。
  • 濃度不等式とカーネル安定性仮定を用いて、経験的演算子と真の演算子の差をバインドすることで収束を確立する。
  • 平均場遷移演算子の構造とカーネルの正則性を活用し、バッチサイズと観測エージェント数の観点から非漸近的誤差バウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1連続的エージェント状態と無限次元の平均場状態を伴う状況下でも、最適価値関数に証明可能に収束するモデルフリーな平均場MARLアルゴリズムを設計できるか?
  • RQ2無限次元の平均場状態であるにもかかわらず、観測エージェント数の増加がアルゴリズムの統計的精度を向上させるか?
  • RQ3平均場MARLにおける学習の計算複雑性が、観測エージェント数に対して線形にスケーリング可能か。これにより、「多数のエージェントの呪い」を克服できるか?
  • RQ4カーネル法を用いて、平均場MARLにおける価値関数近似の非漸近的収束レートを達成できるか?
  • RQ5バッチサイズと観測エージェント数の相互作用が、アルゴリズムの一般化誤差と収束レートにどのように影響するか?

主な発見

  • MF-FQIは反復回数に対して線形収束レートを達成し、収束レートはカーネルのスペクトル特性と正則化パラメータに依存する。
  • アルゴリズムの計算複雑性は観測エージェント数に対して線形にスケーリングされ、多数のエージェントの呪いを効果的に克服する。
  • 観測エージェント数の増加に伴い統計的精度が向上し、「多数のエージェントの賛美」効果が確立される。これは、より大きな標本サイズが推定誤差を低減することを示す。
  • 正則性仮定の下で、一般化誤差はN^{-h/2}の割合で減少する。ここでNは観測エージェント数、hはカーネルの滑らかさパラメータである。
  • カーネル平均埋め込みの安定性に依存して、経験的演算子が真の演算子に高確率で近づくことが濃度不等式を用いてバインドされる。
  • アルゴリズムはバッチサイズと観測エージェント数に依存する非漸近的誤差バウンドを達成しており、カーネルの滑らかさと演算子のスペクトル減衰に明示的な依存関係を持つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。