[论文解读] Incorporating Pragmatic Reasoning Communication into Emergent Language
本文提出了一种计算框架,将短期、对对手敏感的语用推理与多智能体强化学习中的长期涌现语言系统相结合。通过将博弈论语用学与指代游戏和《星际争霸II》中的涌现通信相结合,该模型实现了更准确、更稳健且更简洁的通信,其中双向语用推理优于单向方法,并显著提升了对消息丢失的鲁棒性。
Emergentism and pragmatics are two research fields that study the dynamics of linguistic communication along substantially different timescales and intelligence levels. From the perspective of multi-agent reinforcement learning, they correspond to stochastic games with reinforcement training and stage games with opponent awareness. Given that their combination has been explored in linguistics, we propose computational models that combine short-term mutual reasoning-based pragmatics with long-term language emergentism. We explore this for agent communication referential games as well as in Starcraft II, assessing the relative merits of different kinds of mutual reasoning pragmatics models both empirically and theoretically. Our results shed light on their importance for making inroads towards getting more natural, accurate, robust, fine-grained, and succinct utterances.
研究动机与目标
- 为填补涌现通信研究中的空白,通过结合短期语用推理与长期语言演化来实现。
- 建模智能体如何利用理性、情境敏感的推理来超越既有的语言习惯,提升通信成功率。
- 评估不同语用推理模型(尤其是双向与博弈论方法)在提升通信准确性和鲁棒性方面的有效性。
- 评估语用推理在现实世界多智能体环境(如《星际争霸II》)中的实际影响,特别是在通信噪声下的表现。
- 提供一个统一框架,弥合不同时间尺度和智能水平下语言动态中的涌现主义与语用学。
提出的方法
- 提出一种两阶段框架:首先通过多智能体强化学习实现长期语言涌现,随后利用心理博弈论进行短期语用推理。
- 使用迭代最优响应(IBR)和博弈论均衡来建模语用推理,基于听者预期和行动成本优化话语。
- 通过微分熵和L1-范数最小化引入行动成本与消息压缩,以促进简洁性:最小化 $-H(s(f)) + \int_f p(f)\|s(f)\|_1\,df$。
- 施加约束 $\det(\mathrm{cov}(s(f))) = 1$ 以解决消息表征中的缩放模糊性,从而实现唯一的均衡解。
- 在《星际争霸II》实验中,采用与Wang等人(2019b)相同的神经网络架构和训练设置以保证一致性。
- 在AWS g4dn.xlarge实例上,通过3000万次训练步骤,使用回放缓冲区和随机梯度更新,在1o2r_vs_4r地图中训练智能体。
实验结果
研究问题
- RQ1与纯粹的涌现主义相比,整合短期语用推理在多智能体涌现语言系统中如何提升通信准确性?
- RQ2在指代游戏和复杂环境中,单向与双向语用推理的相对性能如何?
- RQ3博弈论语用学模型在多智能体设置中能在多大程度上作为通信准确性的上限?
- RQ4在《星际争霸II》等实时战略游戏中,语用推理如何增强消息丢失情况下的通信鲁棒性?
- RQ5语用推理能否在涌现语言中促成更简洁、更精细且更符合语境的话语?
主要发现
- 双向语用推理模型在通信准确性上优于单向模型,能更好地利用相互理解与语境。
- 迭代最优响应(IBR)模型在实用的推理深度下实现了高通信准确性,与认知科学中人类的两级推理一致。
- 博弈论语用学模型提供的通信准确率上限高于经典模型,证明了理性均衡计算的价值。
- 在《星际争霸II》中,语用智能体在消息丢失条件下仍保持显著更高的战斗胜率,且随着丢包率上升,性能进一步提升——表明其具备鲁棒性。
- 在50%的消息丢包率下,语用模型相较于非语用基线在胜率上表现出可测量的优势,95%置信区间确认了统计显著性。
- 该模型实现了一种分工形式,使得同一消息(如(0,0,0))根据智能体角色和信念可承载不同的语用含义。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。