Skip to main content
QUICK REVIEW

[论文解读] Colors in Context: A Pragmatic Neural Model for Grounded Language Understanding

Will Monroe, Robert D. Hawkins|arXiv (Cornell University)|Mar 29, 2017
Speech and dialogue systems参考文献 33被引用 6
一句话总结

本文提出了一种实用的神经模型,用于在颜色指代游戏中进行具身语言理解,通过受理性言语行为(Rational Speech Acts)启发的递归推理,结合神经听者与说话者模型。该模型通过整合说话者与听者视角,在相似颜色或模糊描述等困难情形下显著提升了理解准确率,优于仅基于理解或生成训练的基线模型。

ABSTRACT

We present a model of pragmatic referring expression interpretation in a grounded communication task (identifying colors from descriptions) that draws upon predictions from two recurrent neural network classifiers, a speaker and a listener, unified by a recursive pragmatic reasoning framework. Experiments show that this combined pragmatic model interprets color descriptions more accurately than the classifiers from which it is built, and that much of this improvement results from combining the speaker and listener perspectives. We observe that pragmatic reasoning helps primarily in the hardest cases: when the model must distinguish very similar colors, or when few utterances adequately express the target color. Our findings make use of a newly-collected corpus of human utterances in color reference games, which exhibit a variety of pragmatic behaviors. We also show that the embedded speaker model reproduces many of these pragmatic behaviors.

研究动机与目标

  • 开发一种可扩展的、基于学习的具身通信任务中的实用语言理解模型。
  • 研究整合说话者与听者视角如何提升上下文相关指代表达的理解准确率。
  • 创建并发布一个大规模、基于心理语言学动机的人类生成的颜色指代游戏语料库,以供研究使用。
  • 评估神经网络是否能够学习并再现人类交流中观察到的实用行为。
  • 探索递归实用推理在神经模型中用于语言理解的有效性。

提出的方法

  • 该模型使用两个循环神经网络(RNN)分类器:一个用于解释颜色描述的听者,一个用于生成颜色描述的说话者。
  • 实用推理通过受理性言语行为(RSA)启发的递归框架实现,其中实用听者基于说话者的行为推理其意图。
  • 实用听者将听者RNN与说话者RNN的预测结果相结合,说话者模型在困难情形下有助于解决歧义。
  • 该模型在新收集的948组双人颜色指代游戏语料上进行训练与评估,共包含53,365条人类参与者生成的语句。
  • 说话者模型被训练为生成听者模型能正确理解的语句,而听者模型则被训练为在上下文中将语句映射到目标颜色。
  • 最终的实用听者模型融合了听者与说话者RNN的预测结果,说话者视角在歧义上下文中可覆盖错误的听者预测。

实验结果

研究问题

  • RQ1与仅使用听者模型的基线相比,结合说话者与听者视角的神经实用模型是否能提升对颜色描述的理解准确率?
  • RQ2实用推理在区分非常相似的颜色或使用描述性词汇不足的语境中,对性能的提升程度如何?
  • RQ3神经说话者与听者模型是否再现了人类数据中观察到的实用行为,如使用比较级或根据上下文切换颜色术语?
  • RQ4与仅从听者侧依赖实用推理相比,整合说话者与听者视角的效果如何?
  • RQ5基于数据驱动的、学习型RSA框架是否能有效扩展到颜色指代游戏等复杂、语言丰富的领域?

主要发现

  • 结合的实用模型在基线听者-only RNN的基础上显著提升了理解准确率,尤其在涉及相似颜色细微差异的最困难情形下表现突出。
  • 性能提升最大的部分来自整合说话者模型的预测,尽管说话者模型在听者任务上单独表现不佳。
  • 基于听者-only 模型的实用推理也能提升准确率,但收益在困难情形下最为显著——例如当极少语句能充分描述目标颜色,或颜色在视觉上非常接近时。
  • 嵌入的说话者模型成功再现了人类数据中观察到的关键实用行为,如根据干扰色选择不同的基本颜色术语。
  • 该模型表明,实用推理不仅能通过语义解决歧义,还能通过建模对话者预期和上下文相关选择来实现。
  • 结果表明,将语言理解同时建立在生成与理解视角之上,可使现实世界中上下文敏感的交流实现更鲁棒、更准确的理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。