Skip to main content
QUICK REVIEW

[論文レビュー] Formal Contracts Mitigate Social Dilemmas in Multi-Agent RL

Andreas Haupt, Phillip J. K. Christoffersen|arXiv (Cornell University)|Aug 22, 2022
Multi-Agent Systems and Negotiation被引用数 5
ひとこと要約

本稿では、マルチエージェント強化学習(MARL)における社会的ジレンマを解消するメカニズムとして、形式的契約を提案している。エージェントは観察可能な状態に基づき、自発的に報酬を移転することを合意する。契約空間が十分に豊かであれば、報酬移転の提案を可能にすることで、すべての部分ゲーム完全均衡において社会的最適な行動が保証され、静的および動的環境の両方で、全体の福祉が著しく向上する。

ABSTRACT

Multi-agent Reinforcement Learning (MARL) is a powerful tool for training autonomous agents acting independently in a common environment. However, it can lead to sub-optimal behavior when individual incentives and group incentives diverge. Humans are remarkably capable at solving these social dilemmas. It is an open problem in MARL to replicate such cooperative behaviors in selfish agents. In this work, we draw upon the idea of formal contracting from economics to overcome diverging incentives between agents in MARL. We propose an augmentation to a Markov game where agents voluntarily agree to binding transfers of reward, under pre-specified conditions. Our contributions are theoretical and empirical. First, we show that this augmentation makes all subgame-perfect equilibria of all Fully Observable Markov Games exhibit socially optimal behavior, given a sufficiently rich space of contracts. Next, we show that for general contract spaces, and even under partial observability, richer contract spaces lead to higher welfare. Hence, contract space design solves an exploration-exploitation tradeoff, sidestepping incentive issues. We complement our theoretical analysis with experiments. Issues of exploration in the contracting augmentation are mitigated using a training methodology inspired by multi-objective reinforcement learning: Multi-Objective Contract Augmentation Learning (MOCA). We test our methodology in static, single-move games, as well as dynamic domains that simulate traffic, pollution management and common pool resource management.

研究の動機と目的

  • 個々のインcentiveが集団の福祉と対立するMARLにおける社会的ジレンマに対処すること。
  • 中央集権的な調整を必要とせず、自己中心的なエージェントが協調的結果を達成できる分散型メカニズムを設計すること。
  • マーカフゲームに契約ベースの拡張を形式化し、エージェントの自律性を保ちつつ、利他の行動を可能にすること。
  • 契約空間が豊かであるほど、システム全体のパフォーマンスが向上することを示すこと、部分観測環境下でも同様に有効であること。
  • サンプル効率の良い訓練手法を用いて、複雑で動的なドメインへのスケーリングを実現すること。

提案手法

  • 著者らは、完全に観測可能なマーカフゲームに契約拡張を導入し、エージェントが状態・行動依存の報酬移転を提案できるようにしている。
  • 契約は自発的かつ拘束的である:エージェントは提案を拒否できるが、受け入れられた後は契約条項に基づき報酬が変更される。
  • 契約空間が十分に豊かであれば、社会的最適な行動が部分ゲーム完全均衡となるように保証するための「強制的契約」メカニズムを用いている。
  • 価値推定のバイアスを低減し、契約学習におけるサンプル効率を向上させるために、新たな訓練手法「マルチオブジェクティブ契約拡張学習(MOCA)」を提案している。
  • 本手法は、静的ゲームおよび交通、汚染管理、共用資源管理といった動的ドメインで評価されている。
  • 理論的分析により、契約の表現力が十分に高い場合、すべての部分ゲーム完全均衡が社会的最適であることが証明され、契約の表現力が高まればシステム福祉も向上することが示された。

実験結果

リサーチクエスチョン

  • RQ1中央集権的調整やリーダー・フォロワー構造を必要とせず、形式的契約がMARLにおける社会的ジレンマを解消できるか?
  • RQ2契約ベースの報酬移転が、MARLにおいてどのような条件下で社会的最適な均衡をもたらすか?
  • RQ3部分観測環境下において、契約空間の表現力がシステムパフォーマンスおよび福祉に与える影響は何か?
  • RQ4分散的で自己管理型の契約メカニズムは、動的で現実世界を模倣したドメインにおいて、標準的なMARLベースラインを上回る性能を発揮できるか?
  • RQ5一方のエージェントのみが契約を提案できる状況では、契約提案の公平性にどのような影響が生じるか?

主な発見

  • 契約空間が十分に豊かで、ゲームが完全に観測可能な場合、拡張されたゲームのすべての部分ゲーム完全均衡が社会的最適である。
  • 一般設定、特に部分観測ゲームを含む状況において、表現力の高い契約空間は、より高いシステム福祉をもたらすことが示され、契約の複雑さとパフォーマンスの直接的な関連性が裏付けられた。
  • MOCA訓練手法は、サンプル効率を著しく向上させ、価値推定のバイアスを低減し、全テスト環境でベンチマークを上回る性能を示した。
  • 囚人のジレンマでは、裏切り者に1.5単位の罰金を科す契約を導入することで、ゲームが変化し、両エージェントの報酬が-2から-1に向上する唯一のナッシュ均衡が実現された。
  • クリーンアップドメインでは、あるエージェントが川の清掃に対して別のエージェントに報酬を支払う契約を結ぶことで、社会的最適な戦略への完全な協調が達成され、合計報酬が最大化された。
  • 分析から、公平性のトレードオフが明らかになった:契約はシステム福祉を向上させるが、直接的な利益を受けるのは提案を行うエージェントのみであり、公平性が重要な状況では懸念が生じる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。