Skip to main content
QUICK REVIEW

[论文解读] A Neural Language Model for Dynamically Representing the Meanings of Unknown Words and Entities in a Discourse

Sosuke Kobayashi, Naoaki Okazaki|arXiv (Cornell University)|Sep 6, 2017
Topic Modeling参考文献 34被引用 12
一句话总结

本文提出了一种动态神经文本模型,该模型在RNN语言模型的输入层和输出层中基于上下文信息实时构建并更新词嵌入,从而实现对未知词和实体的准确表示。在一项新型匿名语言建模数据集上的实验表明,该模型优于基线模型,其中输出层的动态更新显著提升了重新出现实体的预测性能,而输入层的动态更新则增强了对这些实体后续词语的预测能力。

ABSTRACT

This study addresses the problem of identifying the meaning of unknown words or entities in a discourse with respect to the word embedding approaches used in neural language models. We proposed a method for on-the-fly construction and exploitation of word embeddings in both the input and output layers of a neural model by tracking contexts. This extends the dynamic entity representation used in Kobayashi et al. (2016) and incorporates a copy mechanism proposed independently by Gu et al. (2016) and Gulcehre et al. (2016). In addition, we construct a new task and dataset called Anonymized Language Modeling for evaluating the ability to capture word meanings while reading. Experiments conducted using our novel dataset show that the proposed variant of RNN language model outperformed the baseline model. Furthermore, the experiments also demonstrate that dynamic updates of an output layer help a model predict reappearing entities, whereas those of an input layer are effective to predict words following reappearing entities.

研究动机与目标

  • 为解决神经语言模型中静态、封闭词汇表词嵌入的局限性,后者对未知词一视同仁,并假设词义在所有上下文中保持不变。
  • 基于话语上下文实现实时构建动态词嵌入,以改进序列建模中的词义表示。
  • 评估模型从有限先前出现中推断词义的能力,模拟阅读理解中的一次性学习。
  • 开发并发布一项新的基准任务和数据集——匿名语言建模(Anonymized Language Modeling),用于评估对词义的上下文理解能力。
  • 探究在预测重新出现的实体及其后续上下文时,动态输入层与输出层表示的相对贡献。

提出的方法

  • 该模型采用RNN语言模型的变体,在输入层和输出层均使用动态词嵌入,其中嵌入通过双向RNN编码器从先前上下文计算得出。
  • 对于未知词或词汇表外的词,模型为其分配一个共指索引[k],并利用话语中先前提及的上下文信息构建其嵌入。
  • 模型引入一种复制机制,可直接从上下文复制罕见或未知词到输出,从而提升对OOV词的处理能力。
  • 通过双向RNN编码每个实体提及周围的局部上下文,动态更新实体表示,实现在多次提及间的一致性表示。
  • 模型使用门控RNN(GRU或LSTM)将同一实体的多个上下文表示合并为一个持续演化的向量表示。
  • 输出层动态更新预测词的嵌入,从而提升重新出现实体的预测能力;而输入层的动态机制则有助于提升对这些实体后续词语的预测性能。

实验结果

研究问题

  • RQ1神经语言模型能否基于话语上下文动态构建并更新未知词和实体的嵌入?
  • RQ2在预测重新出现的实体及其上下文时,输入层的动态嵌入与输出层的动态嵌入相比,表现如何?
  • RQ3在话语中仅通过少数先前提及,模型在多大程度上能推断出一个词的含义,从而模拟一次性学习?
  • RQ4在动态嵌入中引入复制机制是否能提升对词汇表外词预测的性能?
  • RQ5所提出的匿名语言建模任务在评估上下文词义获取能力方面是否有效?

主要发现

  • 所提出的动态神经文本模型在新型匿名语言建模数据集上优于使用静态全局词嵌入的基线模型。
  • 输出层的动态更新显著提升了模型预测重新出现实体的能力,表明其在话语中对实体身份的追踪能力更强。
  • 输入层的动态更新在预测重新出现实体之后的词语方面更为有效,表明在识别实体后,上下文建模能力得到提升。
  • 模型成功地从有限的上下文暴露中捕捉到未知词的含义,展示了强大的词义一次性学习能力。
  • 消融实验确认,动态输入层和输出层表示对性能的贡献各不相同,分别在实体追踪和上下文预测中发挥独特作用。
  • 模型能够累积并合并同一实体的多个上下文表示,从而在长篇话语跨度中实现更准确、更一致的语义表示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。