Skip to main content
QUICK REVIEW

[论文解读] Emergence of Theory of Mind Collaboration in Multiagent Systems

Luyao Yuan, Zipeng Fu|arXiv (Cornell University)|Sep 30, 2021
Reinforcement Learning in Robotics参考文献 41被引用 9
一句话总结

该论文提出了一种自适应训练算法,使多智能体系统能够通过仅建模他人心理状态的首阶信念(即信念的信念)来协作学习心智理论(ToM),而无需完整的递归嵌套。通过采用集中式训练与信念监督、去中心化执行的方式,该方法在两种不完美信息博弈中实现了卓越性能,优于所有先前的去中心化算法,并在灵活的智能体分组配置下实现了稳健且通用的协作协议。

ABSTRACT

Currently, in the study of multiagent systems, the intentions of agents are usually ignored. Nonetheless, as pointed out by Theory of Mind (ToM), people regularly reason about other's mental states, including beliefs, goals, and intentions, to obtain performance advantage in competition, cooperation or coalition. However, due to its intrinsic recursion and intractable modeling of distribution over belief, integrating ToM in multiagent planning and decision making is still a challenge. In this paper, we incorporate ToM in multiagent partially observable Markov decision process (POMDP) and propose an adaptive training algorithm to develop effective collaboration between agents with ToM. We evaluate our algorithms with two games, where our algorithm surpasses all previous decentralized execution algorithms without modeling ToM.

研究动机与目标

  • 为解决在部分可观察多智能体系统中实现有效协作的挑战,其中智能体必须在无直接通信的情况下推断他人的心理状态。
  • 克服在多智能体规划与决策中建模高阶递归信念(例如信念的信念的信念)的不可行性。
  • 开发一种利用集中式训练与信念监督来学习有效、可扩展的基于ToM的协调策略的去中心化执行算法。
  • 实现通用的、与群体无关的通信协议,使其在智能体被重新分配至新群体时仍能保持性能。

提出的方法

  • 引入一个多智能体部分可观察马尔可夫决策过程(POMDP)框架,其中智能体维护对自身状态的信念以及对他人私有状态的首阶信念。
  • 使用反事实推理来估计伙伴对自己私有状态的信念,从而在递归的第一层实现信念的信念建模。
  • 在集中式训练阶段,智能体共享其信念估计值作为监督信号,以训练每个智能体的信念估计函数。
  • 采用动态自适应训练调度,即在训练过程中固定一个智能体而仅训练另一个,以确保环境的平稳性并实现稳定学习。
  • 使用预测信念向量与真实信念向量(离散化用于监督)之间的L2范数损失来优化信念估计函数。
  • 实施消息空间约束以防止无效或误导性通信,并通过消息成本机制抑制冗长无益的交流。

实验结果

研究问题

  • RQ1是否可以在无需完整递归信念建模的情况下,在去中心化多智能体系统中有效学习首阶心智理论(即建模他人对自身信念的信念)?
  • RQ2通过自适应信念估计引入ToM,是否能相比非ToM基线方法提升在部分可观察环境中的协作性能?
  • RQ3基于ToM的智能体能否发展出通用的任务级通信协议,使其在跨不同群体更换伙伴时仍保持有效性?
  • RQ4与采用共享模块(如共享Q函数或元智能体)的集中式训练方法相比,该方法在性能与泛化能力方面表现如何?

主要发现

  • 所提出的基于ToM的算法在两种不完美信息博弈中优于所有先前的去中心化执行算法,性能接近最先进的集中式模型。
  • 在预约调度博弈中,该模型的成功率显著高于25%的随机基线和50%的自基提案基线,定量结果见表2及图2(b)。
  • 在灵活分组配置实验中,该方法表现出最低的性能下降,优于BAD和COMA等集中式基线,后者在智能体被重新分配时出现显著性能退化。
  • 经ToM训练的智能体发展出了通用的任务级协议,即使在面对未见过的伙伴时也能实现有效协作,表明其超越群体特异性默契协议的鲁棒性。
  • 在集中式训练中使用信念监督,使智能体能够准确估计伙伴的信念,这对实现无需语言沟通的高层协调至关重要。
  • 自适应训练程序(即训练期间固定一个智能体)成功缓解了非平稳性问题,并在联合学习动态下实现了稳定收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。