Skip to main content
QUICK REVIEW

[论文解读] A multi-agent reinforcement learning model of reputation and cooperation in human groups

Kevin R. McKee, Edward Hughes|arXiv (Cornell University)|Mar 8, 2021
Evolutionary Game Theory and Cooperation被引用 6
一句话总结

本文提出了一种多智能体强化学习模型,模拟声誉驱动的内在动机如何在群体环境中促成类人合作与协调。通过引入声誉追踪机制,该系统仅在个体可识别时,才能复现人类的行为模式——如轮流行动和持续贡献,表明声誉能催化公共品困境中非领地性、时间协调的集体行动。

ABSTRACT

Collective action demands that individuals efficiently coordinate how much, where, and when to cooperate. Laboratory experiments have extensively explored the first part of this process, demonstrating that a variety of social-cognitive mechanisms influence how much individuals choose to invest in group efforts. However, experimental research has been unable to shed light on how social cognitive mechanisms contribute to the where and when of collective action. We build and test a computational model of human behavior in Clean Up, a social dilemma task popular in multi-agent reinforcement learning research. We show that human groups effectively cooperate in Clean Up when they can identify group members and track reputations over time, but fail to organize under conditions of anonymity. A multi-agent reinforcement learning model of reputation demonstrates the same difference in cooperation under conditions of identifiability and anonymity. In addition, the model accurately predicts spatial and temporal patterns of group behavior: in this public goods dilemma, the intrinsic motivation for reputation catalyzes the development of a non-territorial, turn-taking strategy to coordinate collective action.

研究动机与目标

  • 探究社会认知机制(如声誉)如何不仅影响个体的合作程度,还影响其在集体行动中‘在何处’和‘在何时’进行协调。
  • 弥补实验研究中长期聚焦于贡献水平而忽视空间与时间协调动态的空白。
  • 开发并验证一种计算模型,利用多智能体深度强化学习捕捉人类群体中涌现的协调策略。
  • 检验声誉的内在动机是否能够解释复杂时空环境中非领地性、轮流制协调的出现。
  • 将模型预测与来自‘清理’任务的人类行为数据进行对比,以验证模型的生态有效性。

提出的方法

  • 该模型采用多智能体深度强化学习框架,在名为‘清理’的二维网格世界环境中训练,模拟具有空间与时间动态的公共品困境。
  • 智能体接收环境观测信息,包括苹果位置、河流污染水平以及其他智能体的行为动作,并采取运动动作(如移动、清理、惩罚)以最大化个体奖励。
  • 引入基于声誉的内在奖励信号:智能体因提升其在群体中的声誉而获得额外奖励,该信号建模为可观测合作与惩罚行为的函数。
  • 声誉机制通过一个学习到的价值函数实现,用于追踪个体过去行为的一致性与质量,从而影响未来的合作决策。
  • 模型使用深度Q网络(DQN)结合经验回放与目标网络进行训练,并通过轮流行为与贡献一致性等指标评估群体协调水平。
  • 将模型性能与受控实验中的人类行为数据进行对比,采用方差分析(ANOVA)、回归分析与中介效应分析进行统计验证。

实验结果

研究问题

  • RQ1声誉追踪的存在是否能提升在具有空间与时间复杂性的公共品任务中群体行为的一致性与协调性?
  • RQ2可识别性(与匿名性相比)如何影响人类与智能体群体中轮流行为与时间协调策略的出现?
  • RQ3声誉的内在动机在多大程度上中介了群体可识别性与集体绩效之间的关系?
  • RQ4多智能体强化学习模型能否复现人类在贡献一致性与协调策略方面的观察行为模式?
  • RQ5贡献的时间一致性在多大程度上决定了集体行动任务中的群体绩效?

主要发现

  • 在可识别条件下,人类群体的集体回报显著更高(均值 = 244.9),与匿名条件相比,条件对绩效有显著主效应(p < 0.0001)。
  • 在可识别条件下,群体更一致地采用轮流策略,平均轮流得分达0.62,高于匿名条件的0.58(F(1,310) = 29.4, p < 0.0001)。
  • 可识别条件下的贡献时间一致性显著高于匿名条件(均值分别为0.85与0.84),主效应显著(F(1,310) = 9.8, p = 0.0019)。
  • 贡献一致性与集体回报呈正相关(β = 9596.6,95%置信区间 [7537.1, 11656.0],p < 0.0001),表明稳定、可预测的合作能提升群体结果。
  • 中介分析证实,轮流行为显著中介了可识别性对集体回报的影响(间接效应AB = 70.9,95%置信区间 [37.2, 112.4],p < 0.0001),在控制轮流行为后,直接效应从244.9降至174.0。
  • 多智能体强化学习模型成功复现了人类行为模式:在可识别条件下表现出更高合作与协调性,并准确预测了空间与时间协调动态,包括由声誉驱动的非领地性、轮流制策略的出现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。