Skip to main content
QUICK REVIEW

[論文レビュー] Towards Cooperation in Sequential Prisoner's Dilemmas: a Deep Multiagent Reinforcement Learning Approach

Weixun Wang, Jianye Hao|arXiv (Cornell University)|Mar 1, 2018
Evolutionary Game Theory and Cooperation参考文献 25被引用数 16
ひとこと要約

本稿では、協力を時間的に延長され、段階的である「逐次的囚人のジレンマ(SPD)」ゲームにおいて、相互協力を達成するための深層マルチエージェント強化学習手法を提案する。この手法は、協力度の異なるポリシーを生成し、LSTMベースの符号化を用いて協力度検出ネットワークを訓練するオフライン段階と、検出された相手の協力度に基づいてポリシーを動的に選択するオンライン段階から成る。これにより、自己対戦および動的相手の状況下でも、搾取を防ぎつつ強固な協力を実現する。

ABSTRACT

The Iterated Prisoner's Dilemma has guided research on social dilemmas for decades. However, it distinguishes between only two atomic actions: cooperate and defect. In real-world prisoner's dilemmas, these choices are temporally extended and different strategies may correspond to sequences of actions, reflecting grades of cooperation. We introduce a Sequential Prisoner's Dilemma (SPD) game to better capture the aforementioned characteristics. In this work, we propose a deep multiagent reinforcement learning approach that investigates the evolution of mutual cooperation in SPD games. Our approach consists of two phases. The first phase is offline: it synthesizes policies with different cooperation degrees and then trains a cooperation degree detection network. The second phase is online: an agent adaptively selects its policy based on the detected degree of opponent cooperation. The effectiveness of our approach is demonstrated in two representative SPD 2D games: the Apple-Pear game and the Fruit Gathering game. Experimental results show that our strategy can avoid being exploited by exploitative opponents and achieve cooperation with cooperative opponents.

研究の動機と目的

  • 協力が原子的ではなく時間的に延長され、段階的である現実世界の社会的ジレンマをモデル化すること。これは、古典的な繰り返し囚人のジレンマを越えるものである。
  • 直接的な相手の行動観測が制限される大規模状態空間環境においてもスケーラブルかつ適応的であるマルチエージェント強化学習戦略を開発すること。
  • 相手の逐次的行動履歴から協力度を検出でき、適切なポリシーを選択して相互協力を促進できるようにすること。
  • 必要に応じて脱退に即座に切り替えることで、搾取的な相手に対する耐性を確保し、長期的な損失を回避すること。

提案手法

  • 時間的に延長され、段階的な協力行動を有する現実世界の社会的ジレンマをモデル化するための「逐次的囚人のジレンマ(SPD)」フレームワークを提案する。
  • オフライン段階では、重み付きターゲット報酬を用いて、協力度の異なる基本的ポリシーを訓練し、2つの手法(IACおよびJAC)を用いる。
  • 基本的ポリシーから、ポリシー生成手法を用いて連続的な協力度レベルのポリシーを合成する。
  • エンコーダ・デコーダ構造を用いたLSTMベースの協力度検出ネットワークを訓練し、逐次的行動履歴から相手の協力度を推定する。
  • オンライン段階では、検出された協力度に基づいて、合成されたポリシー集合から適切なポリシーを選択し、相手の行動に適応する。
  • リアルタイムでの協力度推定に基づく動的ポリシー切り替えを可能にすることで、Tit-for-Tatの原則をSPDに拡張する。

実験結果

リサーチクエスチョン

  • RQ1協力が二値ではなく段階的・時間的に延長される大規模な、時間的・段階的協力が重要な社会的ジレンマにおいて、相互協力はどのように達成可能か?
  • RQ2直接的な相手のポリシー観測ができない状況下で、深層マルチエージェント強化学習エージェントは、逐次的行動履歴から相手の協力度を検出できるか?
  • RQ3戦略を切り替える相手が存在する動的環境において、協力を維持しつつ搾取への耐性を確保するには、どのようにバランスを取るべきか?
  • RQ4検出された協力度に基づく適応的ポリシー選択は、完全協力や完全脱退といった固定戦略を上回る性能を示せるか?

主な発見

  • 自己対戦シナリオでは、初期ポリシー条件がいかなる場合でも、両エージェントが完全な相互協力に収束した。特に両者が脱退ポリシーから出発した最も挑戦的な状況でも同様であった。
  • Apple-Pearゲームでは、果物収集に伴う強い視覚的・行動的ヒントのおかげで、数エピソードで完全な協力に収束した。
  • Fruit Gatheringゲームでは、協力信号としてビーム発射頻度に依存するため、観測に時間がかかり、収束までに長期間を要した。
  • 戦略を変更する相手に対しては、純粋な協力戦略や純粋な脱退戦略よりも高い平均報酬を達成し、効果的な適応性を示した。
  • 相手が急速にポリシーを切り替える場合、検出精度は低下したが、特に長期的な相互作用では固定戦略を上回る性能を維持した。
  • 提案手法の社会的福祉(報酬の合計)は、すべてのテストシナリオで純粋な協力戦略および純粋な脱退戦略を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。