Skip to main content
QUICK REVIEW

[论文解读] Reference-Aware Language Models

Zichao Yang, Phil Blunsom|arXiv (Cornell University)|Nov 5, 2016
Topic Modeling参考文献 23被引用 10
一句话总结

本文提出了一种参考感知语言模型,将参考决策视为离散的随机潜在变量,从而实现对指代表达(如代词、命名实体、数据库条目)的动态、上下文敏感生成。通过将参考建模为对外部列表、数据库或内部状态的潜在选择,该框架在食谱生成、任务导向对话和指代消解任务中均优于确定性注意力机制和标准语言建模范式,在困惑度和对未见表格条目的零样本泛化方面均有显著提升。

ABSTRACT

We propose a general class of language models that treat reference as an explicit stochastic latent variable. This architecture allows models to create mentions of entities and their attributes by accessing external databases (required by, e.g., dialogue generation and recipe generation) and internal state (required by, e.g. language models which are aware of coreference). This facilitates the incorporation of information that can be accessed in predictable locations in databases or discourse context, even when the targets of the reference may be rare words. Experiments on three tasks shows our model variants based on deterministic attention.

研究动机与目标

  • 为解决现有语言模型在显式建模指代表达(如代词、命名实体)时的局限性,即将其视为动态决策而非静态标记。
  • 使模型不仅能决定生成什么,还能决定从何处生成——外部数据库、配料列表或先前话语内容,通过随机潜在变量实现。
  • 通过显式建模参考决策,提升在需要指代消解、列表引用和数据库交互的应用中的性能。
  • 证明将参考视为潜在变量可实现更好的泛化能力,尤其在对话和食谱生成任务中对罕见或未见的表格条目具有显著优势。

提出的方法

  • 在每个标记位置引入一个潜在变量 $ z_i $,以表示是否以及从何处生成指代表达的决策。
  • 条件概率 $ p(x_i | c_i) $ 通过对 $ z_i $ 进行边缘化计算,其中 $ p(x_i | z_i, c_i) $ 建模从某一来源(如列表、数据库或先前标记)生成的过程,而 $ p(z_i | c_i) $ 建模来源选择的决策。
  • 对于未观测到的 $ z_i $,模型在训练过程中对所有可能的指代对象进行边缘化处理,将参考决策视为潜在变量,从而实现端到端学习。
  • 该框架支持三种设置:对静态列表的引用(如配料列表)、对外部数据库的引用(如餐厅属性),以及文档内部的指代消解(如代词)。
  • 模型采用专家混合方法,不同生成模式(复制、转换、生成)由潜在参考决策条件控制。
  • 模型通过最大似然法训练边际似然 $ p(x_i | c_i) = \sum_{z_i} p(x_i | z_i, c_i) p(z_i | c_i) $,使其能够学习何时复制、何时从词汇表生成。

实验结果

研究问题

  • RQ1将参考决策建模为随机潜在变量,是否能提升语言模型在需要动态引用任务中的性能?
  • RQ2将参考视为潜在选择是否能提升对罕见或未见指代对象(如新数据库条目)的泛化能力?
  • RQ3与基于注意力的机制相比,显式建模参考在困惑度和生成质量方面表现如何?
  • RQ4模型能否根据上下文学习变化指代表达形式(如 'Jane' 与 'she'),而不仅仅是简单复制?

主要发现

  • 采用潜在参考决策的参考感知模型在实体和表格特异性标记上,困惑度显著低于标准语言模型和使用确定性注意力的模型。
  • 在基于指代消解的语言建模中,采用潜在参考决策的模型将实体困惑度从 44.52(LM)降低至 28.56(Pointer + init),表明其指代消解能力显著提升。
  • Table Pointer 模型(显式引用数据库单元格)在表格标记上的困惑度最低(32.62),且在未见表格条目上的表现显著优于未显式建模参考的模型。
  • 采用潜在参考决策的模型在罕见或未见表格条目上的泛化能力更强,表现为对仅在测试集中出现的表格标记困惑度更低。
  • 使用预训练语言模型权重初始化指针模型,显著提升了实体词和非实体词的性能,表明两部分之间实现了有效的参数迁移。
  • 注意力热力图的可视化结果证实,模型能够根据上下文正确选择相关指代对象,如配料列表或数据库条目。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。