Skip to main content
QUICK REVIEW

[論文レビュー] Emergent Reciprocity and Team Formation from Randomized Uncertain Social Preferences

Bowen Baker|arXiv (Cornell University)|Nov 10, 2020
Evolutionary Game Theory and Cooperation被引用数 5
ひとこと要約

本論文では、ランダムで不確実な報酬配分を伴うスケーラブルな環境拡張であるランダム化不確実社会的好み(RUSP)を紹介する。RUSPは、混合動機設定におけるマルチエージェント強化学習エージェントの訓練を可能にし、社会的協力のメカニズムとしての相互扶助、評判システム、チーム形成を、元のゲームダイナミクスを変更せずに発現させる。これにより、行列ゲームおよび複雑な環境において、より高い社会的福祉の均衡に到達する。

ABSTRACT

Multi-agent reinforcement learning (MARL) has shown recent success in increasingly complex fixed-team zero-sum environments. However, the real world is not zero-sum nor does it have fixed teams; humans face numerous social dilemmas and must learn when to cooperate and when to compete. To successfully deploy agents into the human world, it may be important that they be able to understand and help in our conflicts. Unfortunately, selfish MARL agents typically fail when faced with social dilemmas. In this work, we show evidence of emergent direct reciprocity, indirect reciprocity and reputation, and team formation when training agents with randomized uncertain social preferences (RUSP), a novel environment augmentation that expands the distribution of environments agents play in. RUSP is generic and scalable; it can be applied to any multi-agent environment without changing the original underlying game dynamics or objectives. In particular, we show that with RUSP these behaviors can emerge and lead to higher social welfare equilibria in both classic abstract social dilemmas like Iterated Prisoner's Dilemma as well in more complex intertemporal environments.

研究の動機と目的

  • 協力的均衡が存在するが、標準的なマルチエージェント強化学習(MARL)手法がそれらを学習できない社会ジレンマ環境における課題に対処すること。
  • 相互扶助やチーム形成といった社会的反応行動を学習できる汎用的かつスケーラブルな手法を開発すること。
  • 社会的好みに不確実性を伴う混合動機設定でエージェントを訓練し、協力的でないエージェントや人間に対しても頑健な性能を発揮させること。
  • 訓練中に多様で不確実な社会的ダイナミクスにさらされることで、エージェントが現実世界の社会的相互作用に一般化できることを可能にすること。
  • 今後のマルチエージェントシステムにおける社会的ジレンマ研究のためのオープンソース環境を提供すること。

提案手法

  • RUSPは、訓練中にエージェントごとに異なる報酬変換行列をランダムに導入し、各エージェントが他のエージェントと報酬を一部共有するが、共有量については独立した不確実性を導入する。
  • エージェント同士の不確実な関係性に基づいて条件付けられ、情報の非対称性が生じることで、社会的反応行動を学習する圧力が生じる。
  • この手法は元のゲームのダイナミクスや目的を変更しないため、汎用的であり、任意のマルチエージェント環境に適用可能である。
  • 訓練は社会的好みの設定の分布全体にわたって行われ、エージェントが頑健で文脈に応じた協力戦略を学習できるようにする。
  • エージェントは社会的好みを含まない元のゲームで評価され、その行動が標準的な設定で評価されることを保証する。
  • エージェントを固定された集団に割り当てる代わりに、関係性の種別(例:協力的、競争的)に基づいて条件付けすることで、元のゲームでの評価が可能になる。

実験結果

リサーチクエスチョン

  • RQ1元のゲームダイナミクスを変更せずに、マルチエージェント強化学習エージェントが社会的ジレンマにおいて直接的・間接的相互扶助を学習できるか?
  • RQ2不確実でランダムな社会的好みのもとで訓練された場合、MARLエージェントにチーム形成が自然に発現するか?
  • RQ3RUSPは、抽象的な行列ゲームと複雑な時間的連続環境の両方で、より高い社会的福祉の均衡に到達するか?
  • RQ4RUSPで訓練されたエージェントは、協力的でない行動を検知し応答できるように一般化でき、現実世界の社会的ジレンマに適用可能か?
  • RQ5不確実な社会的好みに起因する情報の非対称性が、評判と協力の発現にどのように影響するか?

主な発見

  • RUSPは、複数の環境において、マルチエージェント強化学習エージェントが直接的相互扶助、間接的相互扶助、評判システムを自然に発現させることに成功した。
  • マルチエージェント環境ではチーム形成が自然に発生し、エージェントが共通の好みに基づいて協力的コалиションを自己組織的に形成した。
  • RUSPで訓練されたエージェントは、繰り返し囚人のジレンマと複雑な時間的連続環境の両方で、標準的なMARLベースラインを上回る高い社会的福祉の均衡に到達した。
  • この手法は汎用的かつスケーラブルであり、元のゲームダイナミクスや目的を変更する必要がなく、任意のマルチエージェント環境に適用可能である。
  • 評価結果から、RUSPで訓練されたエージェントは社会的好みを含まない元のゲームでも優れた性能を示し、頑健な一般化が確認された。
  • 著者らは、訓練中に反社会的好みが存在しても、より安定した評判システムが発現することを観察し、社会的好みの訓練におけるより広い設計空間の可能性を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。