Skip to main content
QUICK REVIEW

[论文解读] Building Language Models for Text with Named Entities

Rizwan Parvez, Saikat Chakraborty|arXiv (Cornell University)|May 13, 2018
Topic Modeling参考文献 17被引用 7
一句话总结

本文提出了一种判别式神经语言模型,通过利用实体类型信息来提升命名实体的预测性能,减少词汇表规模并提高准确性。通过联合建模实体类型与特定名称,该方法在食谱生成中实现52.2%的困惑度降低,在代码生成中实现22.06%的困惑度降低,优于当前最先进模型。

ABSTRACT

Text in many domains involves a significant amount of named entities. Predict- ing the entity names is often challenging for a language model as they appear less frequent on the training corpus. In this paper, we propose a novel and effective approach to building a discriminative language model which can learn the entity names by leveraging their entity type information. We also introduce two benchmark datasets based on recipes and Java programming codes, on which we evalu- ate the proposed model. Experimental re- sults show that our model achieves 52.2% better perplexity in recipe generation and 22.06% on code generation than the state-of-the-art language models.

研究动机与目标

  • 解决由于训练数据中低频实体名称导致语言模型命名实体预测性能不佳的问题。
  • 提升在命名实体丰富的领域(如食谱和源代码)中的语言建模性能。
  • 设计一种利用确定性实体类型信息以减少词汇表规模并提高预测准确性的模型。
  • 利用精心整理的食谱和代码数据集,建立实体丰富文本生成的新基准。
  • 证明类型感知建模相较于标准神经语言模型更能捕捉文本的内在模式。

提出的方法

  • 该模型采用两阶段架构:类型模型根据上下文预测下一个词的实体类型。
  • 类型模型通过将同类型的所有实体视为等价,从而减少词汇表规模,提升泛化能力。
  • 实体组合模型随后利用预测的类型作为先验,对候选名称估计条件概率,以预测实际的实体名称。
  • 系统通过联合推理两个模型,生成在上下文和类型上均一致的实体名称。
  • 实体类型信息从本体或静态类型系统(如Java AST中的类型系统)中提取,以实现可扩展且准确的类型标注。
  • 模型采用端到端训练,使用交叉熵损失,以上下文和类型作为输入,预测下一个词。

实验结果

研究问题

  • RQ1利用实体类型信息是否能显著提升语言模型在低频命名实体上的性能?
  • RQ2在食谱和代码等实体丰富的领域中,类型感知语言模型是否优于标准神经语言模型?
  • RQ3类型信息在多大程度上有助于捕捉代码中的全局结构模式,而不仅限于局部上下文?
  • RQ4命名实体的训练频率如何影响性能提升幅度?
  • RQ5联合建模类型与实体名称预测的方法是否能实现比添加类型特征的模型更低的困惑度?

主要发现

  • 所提出的模型在食谱生成任务中相比当前最先进模型实现52.2%的困惑度降低。
  • 在代码生成任务中,模型相比SOTA基线实现22.06%的困惑度降低。
  • 对于低频食材(如'Apple'和'Tomato'),模型在MCQ任务中的准确率提升超过50个百分点。
  • 模型的性能增益与实体训练频率成反比,表明对罕见实体的增益更强。
  • 仅类型模型本身即因词汇表规模减小和泛化能力提升而显著提高预测准确率。
  • 即使仅依赖局部上下文,该模型仍能有效捕捉全局代码模式,其困惑度低于SLP-Core(2.65 vs. 3.40)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。