Skip to main content
QUICK REVIEW

[论文解读] Emergence of Pragmatics from Referential Game between Theory of Mind Agents

Luyao Yuan, Zipeng Fu|arXiv (Cornell University)|Jan 21, 2020
Multi-Agent Systems and Negotiation参考文献 52被引用 12
一句话总结

本文提出一种自适应强化学习算法,使具备心智理论(ToM)的协作智能体能够自发发展出非显式规则约束的语用沟通协议。通过建模彼此对心理状态的一阶信念,并采用迭代最优响应训练,智能体学会推断超出字面语义的语境相关含义,实现高达98.7%的指代准确率,并在经验上逼近递归教学维数(RTD)。

ABSTRACT

Pragmatics studies how context can contribute to language meanings. In human communication, language is never interpreted out of context, and sentences can usually convey more information than their literal meanings. However, this mechanism is missing in most multi-agent systems, restricting the communication efficiency and the capability of human-agent interaction. In this paper, we propose an algorithm, using which agents can spontaneously learn the ability to "read between lines" without any explicit hand-designed rules. We integrate the theory of mind (ToM) in a cooperative multi-agent pedagogical situation and propose an adaptive reinforcement learning (RL) algorithm to develop a communication protocol. ToM is a profound cognitive science concept, claiming that people regularly reason about other's mental states, including beliefs, goals, and intentions, to obtain performance advantage in competition, cooperation or coalition. With this ability, agents consider language as not only messages but also rational acts reflecting others' hidden states. Our experiments demonstrate the advantage of pragmatic protocols over non-pragmatic protocols. We also show the teaching complexity following the pragmatic protocol empirically approximates to recursive teaching dimension (RTD).

研究动机与目标

  • 使多智能体系统能够发展语用沟通,其中意义由语境和相互信念塑造,而非仅依赖字面解释。
  • 解决在多智能体系统中集成递归心智理论(ToM)推理的挑战,同时避免产生不可接受的计算开销。
  • 设计一种可扩展、端到端可训练的框架,使智能体能够学习上下文敏感的消息选择与全局消息映射。
  • 评估语用协议是否在协作教学场景中自然涌现,以及其在准确率与教学复杂度方面相较于非语用基线的表现。
  • 探究人工标注的消息对齐是否能导致逼近教学复杂度理论下限——递归教学维数(RTD)的协议。

提出的方法

  • 将一阶心智理论(ToM)整合到协作多智能体强化学习中,使智能体能够建模彼此对环境及目标对象的心理状态。
  • 采用迭代最优响应(IBR)训练方案:固定一个智能体的策略,同时优化另一个智能体的策略,实现相互适应并收敛至稳定的通信协议。
  • 开发一种自适应强化学习算法,学习信念估计函数以近似伙伴的实际信念,避免高阶信念嵌套带来的计算不可行性。
  • 使用带有符号输入与像素输入的指代游戏设置进行训练,其中教师通过消息向学生传达目标对象。
  • 在联合训练前,通过贝叶斯信念更新对智能体进行预训练,以确保消息对齐的可解释性,提升训练稳定性和可解释性。
  • 通过不同干扰物数量(3个或7个)的测试集评估消息有效性与指代准确率,并计算消息与干扰物属性之间的协方差,以评估上下文敏感性。

实验结果

研究问题

  • RQ1在无显式规则约束的情况下,语用沟通是否能通过仅使用ToM的强化学习在协作多智能体系统中自然涌现?
  • RQ2与字面解释相比,一阶信念建模在多大程度上提升了沟通效率与指代准确率?
  • RQ3所涌现的语用协议在多大程度上逼近递归教学维数(RTD)——教学复杂度的理论下限?
  • RQ4智能体如何基于上下文干扰物动态选择消息?这种选择能否通过消息与干扰物属性的协方差进行量化?
  • RQ5人工标注的消息对齐是否能导致既可解释又高效的协议,从而逼近最优教学复杂度?

主要发现

  • 在7个干扰物条件下,语用协议的指代准确率达到98.7%,在4个干扰物条件下达到98.1%,显著优于非语用基线。
  • 在语用协议下,消息有效性达到98.8%,表明智能体学会了生成语境恰当且有意义的语句。
  • 协方差分析显示,教师会避免使用与干扰物属性对应的消息——例如,当存在颜色干扰物时,更少使用颜色相关消息——证明了上下文敏感的消息选择能力。
  • 在人工标注对齐条件下,所涌现协议的教学复杂度在经验上逼近递归教学维数(RTD),表明其在信息效率上接近最优。
  • 迭代训练过程稳定了协议的演化,保留了有效的通信模式,同时提升了性能,并保持了高水平的人类可解释性。
  • 该模型优于先前方法如L.A. [2017] 和 L.A. [2018],在相同条件下,7个干扰物时准确率达98.1%,4个干扰物时达99.7%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。