Skip to main content
QUICK REVIEW

[論文レビュー] Silly rules improve the capacity of agents to learn stable enforcement and compliance behaviors

Raphaël Koster, Dylan Hadfield-Menell|arXiv (Cornell University)|Jan 25, 2020
Crime, Illicit Activities, and Governance被引用数 8
ひとこと要約

本稿では、無害なベリーの摂取を禁止するなど、任意の「馬鹿げたルール」を導入することで、マルチエージェント強化学習における規範の強制と順守の安定化が図られることを示している。捕食ゲームにおいて、任意のタブーが存在する場合、エージェントは実際のタブー(毒ベリーの摂取)の違反をより信頼性高く罰し、毒ベリーをより速く避けるよう学習する。これは、社会的学習の向上と、誤った罰則の発生が減少するためである。

ABSTRACT

How can societies learn to enforce and comply with social norms? Here we investigate the learning dynamics and emergence of compliance and enforcement of social norms in a foraging game, implemented in a multi-agent reinforcement learning setting. In this spatiotemporally extended game, individuals are incentivized to implement complex berry-foraging policies and punish transgressions against social taboos covering specific berry types. We show that agents benefit when eating poisonous berries is taboo, meaning the behavior is punished by other agents, as this helps overcome a credit-assignment problem in discovering delayed health effects. Critically, however, we also show that introducing an additional taboo, which results in punishment for eating a harmless berry, improves the rate and stability with which agents learn to punish taboo violations and comply with taboos. Counterintuitively, our results show that an arbitrary taboo (a "silly rule") can enhance social learning dynamics and achieve better outcomes in the middle stages of learning. We discuss the results in the context of studying normativity as a group-level emergent phenomenon.

研究の動機と目的

  • マルチエージェント強化学習の文脈において、特に第三者罰則を含む社会的規範がどのように出現し、安定化するかを調査すること。
  • 直接的な機能的影響のない、任意のあるいは「馬鹿げた」ルールが、順従と強制の学習ダイナミクスをどのように改善するかを検討すること。
  • このようなルールが、規範的システムの可読性と観察可能性を高めることで、集団レベルのレジリエンスを向上させるかを探索すること。
  • 集団のサイズ、ベリーの種類数、健康への影響の遅延といった環境パラメータが、規範学習の結果に与える影響を評価すること。
  • エージェントが自ら規範の分類を学習する必要がない条件下で、強化学習のダイナミクスに根ざした集団レベルの出現的現象としての規範性をモデル化すること。

提案手法

  • エージェントがベリーを採取し、社会的タブーに違反する者を罰できるように設計された、空間的・時間的に拡張されたマルチエージェントの捕食ゲームを構築する。
  • トップダウン式の規範的システムを実装し、環境がどの行動を罰できるか(例:毒ベリーの摂取)を定義し、目立つ可視性と報酬信号によって罰則を発動させる。
  • 実際のタブー(毒ベリーの摂取)を維持したまま、無害なベリーの摂取を禁止する任意のタブーを導入する。
  • エージェントを深層強化学習で訓練し、個々の報酬を最大化するようにする。罰則行動は、正しく標的を定めた場合に報酬が得られる。
  • 集団のサイズ、ベリーの種類数、毒の効果が現れるまでの遅延といった環境パラメータを変化させ、耐久性を評価する。
  • 訓練の各段階において、集団の報酬、誤った罰則の頻度、学習速度・安定性を測定し、任意のタブーの影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1任意のタブーの導入が、実際の社会的規範の強制と順従の学習速度と安定性を向上させるか?
  • RQ2集団のサイズ、ベリーの種類数、遅延した結果の遅延といった環境要因が、任意のタブーの利益に与える影響は何か?
  • RQ3ルールの密度(機能的でないものも含む)を高めることで、規範的システムの可読性が向上し、より正確な規範の強制が可能になるか?
  • RQ4馬鹿げたルールの存在が、強化学習エージェントにおける誤った罰則の頻度を低下させるか?
  • RQ5任意のタブーの利益は、すべての学習段階にわたって一貫しているのか、それとも中間段階に限定されるのか?

主な発見

  • 任意のタブーの追加により、特に訓練の中盤において、実際の規範の強制と順従の学習の安定性と速度が顕著に向上する。
  • 任意のタブーを持つエージェントは、それなしのエージェントと比較して、誤った罰則の頻度が低く抑えられており、深層強化学習で一般的に見られる不安定性が軽減されている。
  • 任意のタブーの利益は、集団密度が高く(例:8人)、毒の効果の遅延が長く、ベリーの種類が多い環境で顕著に現れる。これは、信用割り当て問題が深刻になる条件である。
  • これらの困難な条件下では、実際のタブー(R{poisonous})と任意のタブー(R{nonpoisonous})の両方が存在する環境の集団報酬が、実際のタブーのみの環境(R{poisonous})のそれよりも高い。
  • 任意のタブーは、規範的行動を観察する機会を増やすことで、社会的学習を促進し、エージェントが集団の規範強制システムの状態を読み取る能力を向上させる。
  • 任意のタブーの利益は、後期の学習段階では持続しない。これは、非機能的ルールを維持するコストと、規範的システムのレジリエンスの間のトレードオフを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。