Skip to main content
QUICK REVIEW

[论文解读] Learning Reciprocity in Complex Sequential Social Dilemmas

Tom Eccles, Edward Hughes|arXiv (Cornell University)|Mar 19, 2019
Evolutionary Game Theory and Cooperation参考文献 50被引用 22
一句话总结

该论文提出了一种在线强化学习算法,可在复杂顺序性社会困境中学习互惠行为,通过一个学习得到的“亲和力网络”来评估他人行为的社会影响,并利用内在动机使自身行为与对方的合作程度相匹配。该方法使智能体即使在与自私智能体共同学习时,也能诱导出利他性结果,在两人和五人马尔可夫游戏中均优于自私基线模型。

ABSTRACT

Reciprocity is an important feature of human social interaction and underpins our cooperative nature. What is more, simple forms of reciprocity have proved remarkably resilient in matrix game social dilemmas. Most famously, the tit-for-tat strategy performs very well in tournaments of Prisoner's Dilemma. Unfortunately this strategy is not readily applicable to the real world, in which options to cooperate or defect are temporally and spatially extended. Here, we present a general online reinforcement learning algorithm that displays reciprocal behavior towards its co-players. We show that it can induce pro-social outcomes for the wider group when learning alongside selfish agents, both in a $2$-player Markov game, and in $5$-player intertemporal social dilemmas. We analyse the resulting policies to show that the reciprocating agents are strongly influenced by their co-players' behavior.

研究动机与目标

  • 开发一种可扩展的在线强化学习方法,用于处理复杂、时间延展的社会困境,超越简单的矩阵博弈。
  • 解决现有基于规划的互惠模型的局限性,如对预训练策略的依赖、离散策略切换以及对显式奖励的依赖。
  • 使智能体能够在合作与背叛并非二元选择的复杂、连续动作环境中学习互惠行为。
  • 证明即使无法直接访问对手奖励,仅通过内在动机匹配他人社会性水平,也能自然涌现出互惠行为。
  • 表明此类互惠智能体可在多智能体环境中诱导自私合作者合作,从而改善群体整体表现。

提出的方法

  • 该方法采用基于A3C的强化学习框架,并使用VTrace校正来训练创新者(自私)和模仿者(互惠)智能体。
  • 模仿者使用一个学习得到的“亲和力网络”,用于估计一个智能体的行为对另一智能体未来回报的影响,作为社会影响的连续度量。
  • 内在动机驱动模仿者使其自身行为与合作者的社会性水平保持一致,该水平通过亲和力网络进行测量。
  • 亲和力网络通过基于智能体自身回报及对他人影响的自监督目标进行训练,实现对合作行为的在线评估。
  • 该方法避免了硬编码的策略切换,转而学习对他人行为的连续、自适应响应,支持在复杂环境中的可扩展性。
  • 评估了两种变体:一种使用手工设计的社会性特征,另一种使用学习得到的亲和力网络,后者表现出更优的泛化能力。

实验结果

研究问题

  • RQ1在线强化学习智能体是否能在无预定义合作/背叛策略的情况下,于复杂、顺序性社会困境中学习互惠行为?
  • RQ2通过亲和力网络学习到的社会影响度量,与手工设计的特征相比,在促进互惠行为方面表现如何?
  • RQ3在两人和五人马尔可夫游戏中,互惠智能体是否能诱导自私合作者表现出利他行为?
  • RQ4内在动机促使智能体与他人社会性水平保持一致,在时间延展的社会困境中,能在多大程度上改善群体层面的结果?
  • RQ5与amTFT等基于规划的方法相比,该方法在具有连续动作和延迟奖励的环境中是否具备更好的可扩展性?

主要发现

  • 在两人Coins环境中,亲和力网络模仿者实现了0.994 ± 0.003的合作率,显著优于自私基线的0.007 ± 0.001。
  • 亲和力网络准确预测了利他行为,对使自身更接近合作者硬币的动作赋予更低的Q值,表明其识别出了社会成本。
  • 在五人Cleanup环境中,模仿者诱导出向利他行为的转变,当与互惠智能体配对时,创新者(领导者)越来越倾向于清理河流。
  • 该方法成功学习了在合作非二元化环境中互惠行为,能够对他人合作程度做出分级响应。
  • 亲和力网络优于基于度量匹配的基线模型,并在复杂、连续动作环境中表现出鲁棒性,而基于规划的方法(如amTFT)因不可行的轨迹 rollout 而难以应对。
  • 该方法可泛化至两人以上游戏,并支持无需他人奖励显式知识或预训练策略的可扩展、在线学习互惠行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。