Skip to main content
QUICK REVIEW

[论文解读] Theory of Mind as Intrinsic Motivation for Multi-Agent Reinforcement Learning

Ini Oguntola, Joseph Campbell|arXiv (Cornell University)|Jul 3, 2023
Opinion Dynamics and Social Influence被引用 7
一句话总结

本文提出在多智能体强化学习中使用二阶心智理论——预测其他智能体的信念——作为内在奖励信号。通过基于信息论残差方法对语义上有意义的信念进行建模,该方法在混合合作-竞争环境中提升了协调与欺骗能力,实证结果表明,相较于仅使用一阶信念或无信念的基线方法,性能显著提升。

ABSTRACT

The ability to model the mental states of others is crucial to human social intelligence, and can offer similar benefits to artificial agents with respect to the social dynamics induced in multi-agent settings. We present a method of grounding semantically meaningful, human-interpretable beliefs within policies modeled by deep networks. We then consider the task of 2nd-order belief prediction. We propose that ability of each agent to predict the beliefs of the other agents can be used as an intrinsic reward signal for multi-agent reinforcement learning. Finally, we present preliminary empirical results in a mixed cooperative-competitive environment.

研究动机与目标

  • 开发一种在深度强化学习策略中对语义上有意义、人类可解释的信念进行建模的方法。
  • 探究预测其他智能体心理状态(心智理论)是否可作为多智能体强化学习中的内在奖励信号。
  • 通过源自二阶信念预测的内在动机,提升多智能体在混合合作-竞争环境中的性能。
  • 评估该方法在实现复杂社会策略(如欺骗与协调)方面的有效性。

提出的方法

  • 采用概念瓶颈学习的信息论残差变体,通过最小化输入观测与信念表征之间的互信息,以实现语义上的信念建模。
  • 每个智能体维护关于环境的一阶信念(如目标位置、奖励系数)以及关于其他智能体一阶信念的二阶信念。
  • 内在奖励计算为对其他智能体信念的预测准确率,以激励智能体建模他人的心理状态。
  • 使用具有集中训练、分散执行(CTDE)的多智能体近端策略优化(MAPPO)进行训练。
  • 每100,000个时间步交替优化优势智能体与对手,另一方权重保持固定。
  • 通过残差连接将信念预测任务整合到策略网络中,以强制实现解耦且可解释的表征。
Figure 1: Policy models with 1st and 2nd-order belief prediction. The belief predictor is supervised by ground truth labels, and the residual network is regularized via mutual information minimization with respect to beliefs.
Figure 1: Policy models with 1st and 2nd-order belief prediction. The belief predictor is supervised by ground truth labels, and the residual network is regularized via mutual information minimization with respect to beliefs.

实验结果

研究问题

  • RQ1二阶信念预测——即建模其他智能体的信念——是否可在多智能体强化学习中作为有效的内在奖励信号?
  • RQ2将信念基于语义上有意义的概念进行建模,是否能提升多智能体策略的可解释性与性能?
  • RQ3在混合合作-竞争环境中,基于心智理论的内在动机与基于状态新颖性或动作影响的内在奖励相比,表现如何?
  • RQ4该方法是否能促成复杂社会策略(如欺骗与协同规避)的出现?

主要发现

  • 使用二阶信念内在奖励训练的优势智能体在物理欺骗任务中显著优于基线变体,实现了更高的平均回合奖励。
  • 当使用二阶信念内在奖励训练时,对手也表现更优,展现出更强的决断力并更快地抵达目标。
  • 定性分析显示,具备二阶内在奖励的智能体表现出更复杂、更具适应性的策略,包括地标切换与协同规避,这些在基线和一阶信念设置中均未出现。
  • 二阶信念内在奖励促使智能体展现出更具策略性的行为,如故意误导与协同移动,这些行为在缺乏心智理论监督的模型中未被观察到。
  • 该方法表明,基于信念预测的内在动机可驱动社会智能行为的涌现,而无需显式任务设计。
Figure 2: ParticleWorld physical deception environment.
Figure 2: ParticleWorld physical deception environment.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。