Skip to main content
QUICK REVIEW

[論文レビュー] Learning Reciprocity in Complex Sequential Social Dilemmas

Tom Eccles, Edward Hughes|arXiv (Cornell University)|Mar 19, 2019
Evolutionary Game Theory and Cooperation参考文献 50被引用数 22
ひとこと要約

本論文では、学習された「にこみネットワーク」を用いて他者の社会的影響を評価し、協力的行動を模倣する内因的動機を有するオンライン強化学習アルゴリズムを提案している。この手法により、協力的でないエージェントと共に学習しても、2人および5人のプレイヤーにおけるマルコフゲームにおいて、自己中心的なベースラインを上回るプローソーシャルな結果を達成できる。

ABSTRACT

Reciprocity is an important feature of human social interaction and underpins our cooperative nature. What is more, simple forms of reciprocity have proved remarkably resilient in matrix game social dilemmas. Most famously, the tit-for-tat strategy performs very well in tournaments of Prisoner's Dilemma. Unfortunately this strategy is not readily applicable to the real world, in which options to cooperate or defect are temporally and spatially extended. Here, we present a general online reinforcement learning algorithm that displays reciprocal behavior towards its co-players. We show that it can induce pro-social outcomes for the wider group when learning alongside selfish agents, both in a $2$-player Markov game, and in $5$-player intertemporal social dilemmas. We analyse the resulting policies to show that the reciprocating agents are strongly influenced by their co-players' behavior.

研究の動機と目的

  • 単純な行列ゲームを超えた、時間的に延長された複雑な社会的ジレンマにおいても機能するスケーラブルでオンラインの強化学習的手法による報酬の学習を実現すること。
  • 事前訓練済みポリシーへの依存、離散的戦略切り替え、明示的な報酬観測に依存する既存の計画ベースの報酬モデルの限界を克服すること。
  • 協力と裏切りが二値的選択でない連続的行動環境において、エージェントが洗練された形で報酬を学ぶこと。
  • 直接的な相手の報酬のアクセスがなくても、他者の社会性に合わせる内因的動機によって、報酬行動が自然に出現することを示すこと。
  • このような報酬的エージェントが、自己中心的な共同プレイヤーに協力を誘発でき、マルチエージェント環境における集団的成果を向上させられることを示すこと。

提案手法

  • A3Cベースの強化学習フレームワークにVTrace補正を適用し、イノベーター(自己中心的)およびイミテーター(報酬的)エージェントの両方を訓練する。
  • イミテーターは、1人のエージェントの行動が他者の将来の報酬に与える影響を推定する学習済みの「にこみネットワーク」を採用しており、社会的影響の連続的測定値として機能する。
  • イミテーターは、相手プレイヤーの社会性レベルに合わせて自らの行動を調整する内因的動機を持つ。
  • にこみネットワークは、エージェント自身の報酬と他者への影響を観測した自己教師あり目的関数に基づいて学習され、協力のオンライン評価を可能にする。
  • このアプローチは、ハードコードされた戦略切り替えを避けており、他者の行動に連続的かつ適応的に反応する学習を実現し、複雑な環境へのスケーラビリティを支援する。
  • 2つのバリエーションを評価:社会性のためのハンドクラフト特徴量を使用するバージョンと、学習済みのにこみネットワークを使用するバージョン。後者の方が優れた一般化性能を示した。

実験結果

リサーチクエスチョン

  • RQ1事前定義された協力/裏切りポリシーがなく、オンライン強化学習エージェントが複雑で逐次的な社会的ジレンマにおいて報酬を学べるか?
  • RQ2にこみネットワークによる社会的影響の測定値は、ハンドクラフト特徴量と比較して、報酬的行動を促進するためにどれほど効果的か?
  • RQ3報酬的エージェントは、2人および5人のプレイヤーにおけるマルコフゲームにおいて、自己中心的な共同プレイヤーにプローソーシャル行動を誘発できるか?
  • RQ4他者の社会性に合わせる内因的動機は、時間的延長を伴う社会的ジレンマにおいて、集団レベルの成果をどの程度向上させるか?
  • RQ5連続的行動と遅延報酬を伴う環境において、本手法はamTFTのような計画ベースの手法と比較してどの程度スケーリング可能か?

主な発見

  • 2人プレイヤーのCoins環境では、にこみネットワークを搭載したイミテーターが協力率0.994 ± 0.003を達成し、自己中心的ベースラインの0.007 ± 0.001を著しく上回った。
  • にこみネットワークはプローソーシャル行動を正確に予測し、相手プレイヤーのコインに近づく動きに対して低いQ値を割り当て、社会的コストを認識していた。
  • 5人プレイヤーのCleanup環境では、イミテーターがプローソーシャル行動へのシフトを誘発し、リーダーとして機能するイノベーターが報酬的エージェントとペアになると、川を清掃する傾向が高まった。
  • この手法は、協力が二値的でない環境でも、他者の協力的水準に応じた段階的な反応を学習でき、報酬的行動を適切に学習した。
  • にこみネットワークはメトリックマッチングベースラインを上回り、計画ベースの手法(amTFT)が実行不能なロールアウトを経験するような複雑で連続的行動の環境でも、頑健な性能を示した。
  • 本手法は2人ゲームにとどまらず、他者の報酬や事前訓練済みポリシーの明示的知識が不要な状態で、スケーラブルかつオンラインで報酬を学習可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。