Skip to main content
QUICK REVIEW

[论文解读] Extending rational models of communication from beliefs to actions

Theodore R. Sumers, Robert D. Hawkins|arXiv (Cornell University)|May 25, 2021
Topic Modeling参考文献 24被引用 8
一句话总结

本文提出了一种名为信号老虎机(signaling bandits)的新框架,用于统一理性沟通模型中的信念目标与行为目标。通过将听者决策过程整合到说话者推理中,联合说话者模型生成了更具真实性、可泛化性以及行为有效性的语言——尤其在复杂且不确定的环境中表现更优,其在模拟实验中优于纯粹基于信念或行为的方法。

ABSTRACT

Speakers communicate to influence their partner's beliefs and shape their actions. Belief- and action-based objectives have been explored independently in recent computational models, but it has been challenging to explicitly compare or integrate them. Indeed, we find that they are conflated in standard referential communication tasks. To distinguish these accounts, we introduce a new paradigm called signaling bandits, generalizing classic Lewis signaling games to a multi-armed bandit setting where all targets in the context have some relative value. We develop three speaker models: a belief-oriented speaker with a purely informative objective; an action-oriented speaker with an instrumental objective; and a combined speaker which integrates the two by inducing listener beliefs that generally lead to desirable actions. We then present a series of simulations demonstrating that grounding production choices in future listener actions results in relevance effects and flexible uses of nonliteral language. More broadly, our findings suggest that language games based on richer decision problems are a promising avenue for insight into rational communication.

研究动机与目标

  • 弥合信念驱动与行为驱动的理性沟通模型目标之间的鸿沟,这些目标此前被视为独立或混淆的。
  • 解决现有模型仅关注信念传递而忽略现实后果或行为影响的局限性。
  • 开发一个统一框架,使说话者能够推理话语如何塑造听者的信念,并最终影响决策情境中的行为。
  • 探究将沟通基于下游行为是否能导致更相关、更真实且更具可泛化性的语言使用。
  • 通过一种新的任务范式——信号老虎机——对模型进行验证,该范式将经典信号博弈推广至多臂老虎机决策问题。

提出的方法

  • 提出一种名为“信号老虎机”的新任务范式,通过将多臂老虎机决策问题中的随机奖励嵌入,扩展了Lewis信号博弈。
  • 构建三种说话者模型:基于信念的说话者(最大化信息量)、基于行为的说话者(最大化期望行为效用)以及联合说话者(通过诱导信念优化期望效用)。
  • 以理性言语行为(Rational Speech Acts, RSA)框架为基础,扩展其适用范围,使其涵盖对行为的效用函数,而不仅限于信念。
  • 采用带温度参数(β)的软最大决策策略,以建模说话者的最优性,从而实现话语选择的随机性。
  • 引入听者推理过程,基于话语更新信念,并选择能最大化该信念下期望效用的行为。
  • 在不同情境(局部与全局决策时域)下模拟说话者行为,并使用真实性、行为最优性及奖励等指标评估性能。

实验结果

研究问题

  • RQ1在决策情境中,基于信念的说话者与基于行为的说话者在话语选择与表现上存在哪些差异?
  • RQ2是否能够通过整合信念形成与行为结果的统一说话者模型,实现比纯粹基于信念或行为的模型更有效的沟通?
  • RQ3是否将沟通基于未来听者的行动,能导致更具可泛化性与情境鲁棒性的语言使用?
  • RQ4在复杂的决策环境中,信息量与行为相关性之间的最优平衡如何自然浮现?
  • RQ5听者的决策时域(局部与全局)在塑造说话者话语的结构与真实性方面发挥何种作用?

主要发现

  • 联合说话者模型在所有指标上均优于基于信念与基于行为的模型,在局部与全局情境下均实现了更高的期望奖励与更优的行为最优性。
  • 在全局情境(模拟3)中,当β→∞时,联合说话者以100%的概率收敛于产生真实话语⟨Green, 2⟩,而基于行为的说话者则对⟨Green, 2⟩与⟨Circle, 2⟩保持无差别。
  • 基于行为的说话者频繁产生虚假或夸张的话语(如误导性信号),虽能提升行为结果,但扭曲了信念,尤其在局部情境中更为明显。
  • 联合说话者对底层奖励结构的敏感性,使其倾向于选择真实、可泛化的语言,从而在多样化未来情境中支持最优行为。
  • 即使在高最优性(β→∞)下,当多个话语产生等效行为结果时,基于行为的说话者仍无法收敛至真实信息,而联合说话者可以。
  • 基于信念的说话者对β不敏感,因为在均匀先验下所有真实话语的信息量相等,但其无法支持与行为相关联的决策。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。