Skip to main content
QUICK REVIEW

[论文解读] Emergent Reciprocity and Team Formation from Randomized Uncertain Social Preferences

Bowen Baker|arXiv (Cornell University)|Nov 10, 2020
Evolutionary Game Theory and Cooperation被引用 5
一句话总结

本文提出了随机化不确定社会偏好(RUSP),一种可扩展的环境增强方法,通过在混合动机设置中对奖励分配进行随机化和不确定性处理,训练多智能体强化学习智能体。RUSP 在不改变原始游戏动态的前提下,诱导出涌现的互惠、声誉系统和团队形成——这些是关键的社会合作机制,从而在矩阵博弈和复杂环境中实现更高社会福利的均衡。

ABSTRACT

Multi-agent reinforcement learning (MARL) has shown recent success in increasingly complex fixed-team zero-sum environments. However, the real world is not zero-sum nor does it have fixed teams; humans face numerous social dilemmas and must learn when to cooperate and when to compete. To successfully deploy agents into the human world, it may be important that they be able to understand and help in our conflicts. Unfortunately, selfish MARL agents typically fail when faced with social dilemmas. In this work, we show evidence of emergent direct reciprocity, indirect reciprocity and reputation, and team formation when training agents with randomized uncertain social preferences (RUSP), a novel environment augmentation that expands the distribution of environments agents play in. RUSP is generic and scalable; it can be applied to any multi-agent environment without changing the original underlying game dynamics or objectives. In particular, we show that with RUSP these behaviors can emerge and lead to higher social welfare equilibria in both classic abstract social dilemmas like Iterated Prisoner's Dilemma as well in more complex intertemporal environments.

研究动机与目标

  • 解决标准多智能体强化学习方法在合作均衡存在但无法被学习的社会困境环境中的失败问题。
  • 开发一种通用且可扩展的方法,使智能体能够学习诸如互惠和团队形成等社会反应行为。
  • 在社会偏好存在不确定性的混合动机设置中训练智能体,确保对非合作智能体和人类的鲁棒性。
  • 通过在训练中暴露于多样化且不确定的社会动态,使智能体能够泛化到现实世界的社会互动。
  • 开源环境,以促进多智能体系统中社会困境的进一步研究。

提出的方法

  • RUSP 在训练过程中引入随机化、智能体特定的奖励变换矩阵,其中每个智能体以一定比例与他人共享奖励,但对共享比例存在独立的不确定性。
  • 智能体根据彼此之间不确定的关系进行条件化,从而产生信息不对称,迫使其学习社会反应型策略。
  • 该方法不改变原始游戏的动力学或目标,因此具有通用性,可适用于任何多智能体环境。
  • 训练在一系列社会偏好配置的分布上进行,使智能体能够学习到稳健且上下文敏感的合作策略。
  • 评估在不包含社会偏好的原始游戏中进行,以确保智能体行为在标准设置下被评估。
  • 该方法基于智能体之间的关系类型(如合作型、竞争型)进行条件化,而非固定其所属群体,从而实现对原始游戏的评估。

实验结果

研究问题

  • RQ1在不改变底层游戏动态的前提下,多智能体强化学习智能体能否在社会困境中学习直接互惠与间接互惠?
  • RQ2当在不确定且随机化的社会偏好下进行训练时,团队形成是否能在多智能体强化学习智能体中自然涌现?
  • RQ3RUSP 是否能在抽象矩阵博弈和复杂的时间动态环境中实现更高的社会福利均衡?
  • RQ4经过 RUSP 训练的智能体是否能通过学习识别并响应非合作行为,从而泛化到现实世界的社会困境?
  • RQ5来自不确定社会偏好的信息不对称如何影响声誉与合作的涌现?

主要发现

  • RUSP 在多个环境中成功诱导出多智能体强化学习智能体的涌现性直接互惠、间接互惠与声誉系统。
  • 在多智能体环境中,团队形成自然涌现,智能体根据共享偏好自发组织成合作联盟。
  • 经过 RUSP 训练的智能体在重复囚徒困境和复杂时间动态环境中均实现了更高的社会福利均衡,优于标准多智能体强化学习基线方法。
  • 该方法具有通用性和可扩展性,无需修改原始游戏的动力学或目标,可应用于任何多智能体环境。
  • 评估结果表明,经过 RUSP 训练的智能体在不包含社会偏好的原始游戏中表现更优,表明其具备稳健的泛化能力。
  • 作者观察到,训练期间的反社会偏好反而促成了更稳定涌现的声誉系统,提示社会偏好训练具有更广阔的设计空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。