Skip to main content
QUICK REVIEW

[論文レビュー] Influencing Long-Term Behavior in Multiagent Reinforcement Learning

Dong Ki Kim, Matthew Riemer|arXiv (Cornell University)|Mar 7, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本稿では、他のエージェントの収束する方策に対する長期的影響をモデル化することで、エージェントの方策を最適化する予見的なフレームワークFURTHERを提案する。アクティブなマルコフゲームを定式化し、変分推論を用いた方策勾配法を用いることで、多エージェント強化学習(MARL)の多様な環境において、短視眼的なベースラインと比較して優れた長期的パフォーマンスを達成し、より望ましい均衡に一貫して収束する。

ABSTRACT

The main challenge of multiagent reinforcement learning is the difficulty of learning useful policies in the presence of other simultaneously learning agents whose changing behaviors jointly affect the environment's transition and reward dynamics. An effective approach that has recently emerged for addressing this non-stationarity is for each agent to anticipate the learning of other agents and influence the evolution of future policies towards desirable behavior for its own benefit. Unfortunately, previous approaches for achieving this suffer from myopic evaluation, considering only a finite number of policy updates. As such, these methods can only influence transient future policies rather than achieving the promise of scalable equilibrium selection approaches that influence the behavior at convergence. In this paper, we propose a principled framework for considering the limiting policies of other agents as time approaches infinity. Specifically, we develop a new optimization objective that maximizes each agent's average reward by directly accounting for the impact of its behavior on the limiting set of policies that other agents will converge to. Our paper characterizes desirable solution concepts within this problem setting and provides practical approaches for optimizing over possible outcomes. As a result of our farsighted objective, we demonstrate better long-term performance than state-of-the-art baselines across a suite of diverse multiagent benchmark domains.

研究の動機と目的

  • 同時に学習を進め、その行動が相互に進化するエージェントによって引き起こされる非定常性に対処すること。
  • 時間無限大に近づくにつれて、他のエージェントの制限的方策を予測・影響することが可能なフレームワークを形式化すること。
  • 他のエージェントの収束行動への影響を考慮することで、平均的な長期的報酬を最大化する実用的な最適化手法を開発すること。
  • 短視眼的または影響を与えない手法と比較して、予見的な影響がより良い均衡選択をもたらすかどうかを示すこと。
  • 変分推論と特化したベルマン更新を用いて、分散型の学習と実行を可能にすること。

提案手法

  • 非定常性を連携方策更新の有向グラフィカルモデルとしてモデル化することで、マルチエージェント学習をアクティブなマルコフゲームとして形式化する。
  • 他のエージェントの収束方策の極限分布における平均報酬を最大化する新しい最適化目的を導入する。
  • アクティブなマルコフゲームに適した特化したベルマン更新則を用いた、方策勾配に基づくFURTHERアルゴリズムを開発する。
  • 変分推論を用いて他のエージェントの方策更新関数を近似し、分散型の実行と学習を可能にする。
  • 大規模なマルチエージェント設定へのスケーリングを図るために、平均場法を統合する。
  • 長期間にわたるメタ学習を扱えるようにするため、自エージェント自体の方策を固定・定常と仮定する。

実験結果

リサーチクエスチョン

  • RQ1マルチエージェントシステムにおけるエージェントは、他の学習エージェントの長期的行動を効果的に影響させることができるか?
  • RQ2MARLにおいて、無限時間方策収束を考慮するのと有限時間近似を考慮するのとで、それぞれの影響は何か?
  • RQ3予見的な最適化目的は、短視眼的または影響を与えない手法と比較して、より良い均衡選択をもたらすか?
  • RQ4本フレームワークは、協調的、競合的、および混合設定を含む多様なマルチエージェントベンチマーク環境でどのように性能を発揮するか?
  • RQ5変分推論は、長期的影響をモデル化しつつ、分散型学習を可能にする役割を果たすか?

主な発見

  • FURTHERは、IBS、IC、IMP、RoboSumo、Battleを含む複数のMARL環境で、最先端のベースラインと比較して一貫して高い長期的平均報酬を達成する。
  • IBSゲームでは、FURTHERは最適な純粋戦略ナッシュ均衡に成功して収束するが、ベースラインはその達成に失敗する。
  • 競合的環境(例:IMP)では、FURTHERはMOA や DRON といった短視眼的ベースラインを上回り、その限界の見通しのなさにより容易に狙われることなく優位に立つ。
  • 特に大規模設定において平均場近似と組み合わせた場合に、ロバストネスとスケーラビリティを示す。
  • FURTHERはセルフプレイおよび協調的状況でも優れた性能を発揮し、ベースラインよりも良好な収束性能を達成する。
  • さまざまなハイパーパrameter設定において安定した性能を示し、平均報酬と収束品質の両面で一貫した向上を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。