[论文解读] Dynamic Entity Representations in Neural Language Models
本文提出 EntityNLM,一种生成式神经语言模型,能够动态维护并更新上下文中的实体分布式表示,从而提升语言建模、共指消解和实体预测性能。通过显式追踪实体及其演化表示,该模型在三项任务上均优于强基线模型,证明了在序列生成中采用动态实体建模的价值。
Understanding a long document requires tracking how entities are introduced and evolve over time. We present a new type of language model, EntityNLM, that can explicitly model entities, dynamically update their representations, and contextually generate their mentions. Our model is generative and flexible; it can model an arbitrary number of entities in context while generating each entity mention at an arbitrary length. In addition, it can be used for several different tasks such as language modeling, coreference resolution, and entity prediction. Experimental results with all these tasks demonstrate that our model consistently outperforms strong baselines and prior work.
研究动机与目标
- 为解决现有语言模型在长上下文下无法显式追踪实体及其演化角色的局限性。
- 开发一种生成模型,为文本中提及的每个实体维护动态、上下文敏感的表示。
- 通过利用实体特定的表示,提升共指消解、语言建模和实体预测的性能。
- 在统一框架内支持灵活的推理模式——语言建模、共指重排序和实体完形填空。
提出的方法
- 该模型在循环神经网络语言模型基础上,为每个词元引入三个关键的随机变量:R_t(提及指示符)、L_t(当前提及长度)和 E_t(实体索引)。
- 每个实体被分配一个连续向量表示 e_i,t,当该实体被提及时,通过类似 LSTM 的门控机制动态更新。
- 模型采用分层生成式生成过程:实体提及基于实体表示生成,而这些表示又反过来影响后续词的预测。
- 仅在实体被提及时才更新其表示,从而实现稀疏、上下文敏感的内存分配。
- 模型在标注有实体提及和共指关系的数据上进行端到端训练,使用词和实体变量的联合似然目标。
- 推理支持多种模式:完整文本生成、通过边际化实现的共指重排序,以及通过条件概率估计实现的实体预测。
实验结果
研究问题
- RQ1神经语言模型能否显式维护并更新实体的动态表示,以改善长上下文理解?
- RQ2引入动态实体表示对语言建模、共指消解和实体预测性能有何影响?
- RQ3同一模型架构能否通过共享实体表示灵活应用于多种自然语言处理任务?
- RQ4动态实体建模是否优于静态或仅上下文相关的实体表示,展现出更好的泛化能力?
主要发现
- 在 CoNLL 2012 语言建模任务中,EntityNLM 在 n-gram 和 RNN 语言模型的强基线基础上表现更优,通过显式实体追踪显著降低了困惑度。
- 当用于重排序现有系统生成的 k 个最佳输出时,该模型显著提升了共指消解性能,在 CoNLL 2012 测试集上达到最先进结果。
- 在 InScript 实体预测语料库上,EntityNLM 达到最先进性能,优于依赖预定义实体类型的先前方法。
- 该模型能够上下文相关地生成实体提及,并动态更新实体表示,从而实现更连贯、更准确的文本生成。
- 该框架在单一统一架构内支持多种推理模式——语言建模、共指消解和实体预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。