Skip to main content
QUICK REVIEW

[論文レビュー] Model-free conventions in multi-agent reinforcement learning with heterogeneous preferences

Raphaël Koster, Kevin R. McKee|arXiv (Cornell University)|Oct 18, 2020
Reinforcement Learning in Robotics参考文献 74被引用数 11
ひとこと要約

本稿は、異種の好みを持つマルチエージェントシステムにおけるモデルフリー強化学習が、モデルベースの計画や共通知識を必要とせずに、集団的モノカルチャー状態などの複雑で安定した協調慣習を生じさせることを示している。個々のエージェントが対立する内発的好みを持つにもかかわらず、習慣的学習を通じて自発的に慣習を確立・維持し、逸脱しても大きな好みの補償が必要な状況でさえも、ネッシュ均衡およびパレート最適な結果を達成する。

ABSTRACT

Game theoretic views of convention generally rest on notions of common knowledge and hyper-rational models of individual behavior. However, decades of work in behavioral economics have questioned the validity of both foundations. Meanwhile, computational neuroscience has contributed a modernized 'dual process' account of decision-making where model-free (MF) reinforcement learning trades off with model-based (MB) reinforcement learning. The former captures habitual and procedural learning while the latter captures choices taken via explicit planning and deduction. Some conventions (e.g. international treaties) are likely supported by cognition that resonates with the game theoretic and MB accounts. However, convention formation may also occur via MF mechanisms like habit learning; though this possibility has been understudied. Here, we demonstrate that complex, large-scale conventions can emerge from MF learning mechanisms. This suggests that some conventions may be supported by habit-like cognition rather than explicit reasoning. We apply MF multi-agent reinforcement learning to a temporo-spatially extended game with incomplete information. In this game, large parts of the state space are reachable only by collective action. However, heterogeneity of tastes makes such coordinated action difficult: multiple equilibria are desirable for all players, but subgroups prefer a particular equilibrium over all others. This creates a coordination problem that can be solved by establishing a convention. We investigate start-up and free rider subproblems as well as the effects of group size, intensity of intrinsic preference, and salience on the emergence dynamics of coordination conventions. Results of our simulations show agents establish and switch between conventions, even working against their own preferred outcome when doing so is necessary for effective coordination.

研究の動機と目的

  • モデルフリーの強化学習が、異種の好みを持つマルチエージェントシステムにおいて、複雑な社会的慣習の出現を支援できるかどうかを調査すること。
  • 不完全情報、集団的行動の必要性、および対立する個々の好みが存在する環境において、慣習がどのように形成されるかを検討すること。
  • エージェントが異なる内発的報酬を持つにもかかわらず、そのような慣習がネッシュ均衡およびパレート最適であるかどうかを評価すること。
  • 集団の規模、好みの強度、顕在性が慣習の出現および安定性に与える影響を分析すること。

提案手法

  • エージェントが色の異なるブドウを採餌するが、それぞれに異種の内発的好みを持つ、時空間的に拡張されたマルチエージェント強化学習環境を設計した。
  • エージェントは、環境の計画やモデル化を一切行わず、即時の報酬に基づいてポリシーを学習するモデルフリーのディープQラーニングを使用した。
  • 環境には、エージェントがブドウを再生可能であり、これにより支配的色が変化し、集団の成長率に影響を与えるモノカルチャー機構が備わっている。
  • 報酬関数は、エージェントが好むブドウ色を消費した場合に高い報酬を得るよう構造化されているが、再生は支配的色の成長率を低下させる。
  • 理論的分析により、モノカルチャー状態がネッシュ均衡となる条件を導出。これは、支配的ブドウの収穫損失と好む色の消費による利益のトレードオフに基づく。
  • シミュレーションでは、集団の規模、好みの強度(t)、および顕在性を変化させ、慣習の出現ダイナミクスおよび安定性を調査した。

実験結果

リサーチクエスチョン

  • RQ1モデルベースの計画が存在しない状況下で、モデルフリーのマルチエージェント強化学習が、安定的かつ大規模な協調慣習を生じさせられるか?
  • RQ2異種の内発的好みがあるにもかかわらず、エージェントがモノカルチャー状態に収束する条件は何か?
  • RQ3集団の規模、内発的好みの強度、顕在性は、慣習の出現および安定性にどのように影響するか?
  • RQ4エージェントが協調のための個人の好みを犠牲にしなければならない状況でも、出現した慣習がネッシュ均衡およびパレート最適であるか?

主な発見

  • すべてのエージェントが1つのブドウ色に協調するモノカルチャー状態は、好む色の相対的報酬が支配的ブドウの収穫損失を補填するのに十分でない場合、ネッシュ均衡として出現する。
  • 理論的分析により、支配的ブドウの成長損失が好む色の消費による利益を上回る場合、たとえ好みの比率がわずかに(t=2)であっても、モノカルチャー状態がネッシュ均衡であることが確認された。
  • 集団内に少なくとも2つの異なるグループ的目標が存在する場合、モノカルチャー状態はパレート最適である。なぜなら、すべての同じ目標を持つエージェントの報酬を向上させる代替状態が存在しないからである。
  • エージェントは頻繁に慣習を切り替え、協調を維持するために好まない結果を放棄する傾向を示しており、個々の好みに対して強い耐性を示している。
  • 大きな集団の規模と高い好みの強度は、慣習の安定性を高めるが、顕在性は共通の慣習への収束を加速させる。
  • モデルフリーのアプローチは、明示的な計画や共通知識を必要とせず、大規模で情報が不完全な環境においても、深い協調問題を効果的に解決できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。