Skip to main content
QUICK REVIEW

[论文解读] Knowledge-Augmented Language Model and its Application to Unsupervised Named-Entity Recognition

Angli Liu, Jingfei Du|arXiv (Cornell University)|Apr 9, 2019
Topic Modeling参考文献 22被引用 9
一句话总结

本文提出知识增强语言模型(KALM),一种可端到端训练的语言模型,通过整合外部知识库(KB)中的实体和类型信息,以提升语言建模性能并实现无监督命名实体识别(NER)。通过使用上下文相关的门控机制,在通用词汇与KB实体之间进行选择,KALM在语言建模任务上达到最先进(SOTA)的困惑度表现,并在NER任务上取得0.86的F1分数,与仅使用40%数据训练的监督模型性能相当。

ABSTRACT

Traditional language models are unable to efficiently model entity names observed in text. All but the most popular named entities appear infrequently in text providing insufficient context. Recent efforts have recognized that context can be generalized between entity names that share the same type (e.g., \emph{person} or \emph{location}) and have equipped language models with access to an external knowledge base (KB). Our Knowledge-Augmented Language Model (KALM) continues this line of work by augmenting a traditional model with a KB. Unlike previous methods, however, we train with an end-to-end predictive objective optimizing the perplexity of text. We do not require any additional information such as named entity tags. In addition to improving language modeling performance, KALM learns to recognize named entities in an entirely unsupervised way by using entity type information latent in the model. On a Named Entity Recognition (NER) task, KALM achieves performance comparable with state-of-the-art supervised models. Our work demonstrates that named entities (and possibly other types of world knowledge) can be modeled successfully using predictive learning and training on large corpora of text without any additional information.

研究动机与目标

  • 通过整合外部知识库(KB)中的事实性知识,特别是针对罕见命名实体,提升语言建模性能。
  • 在不依赖标注训练数据或外部标注器的前提下,实现无监督命名实体识别(NER)。
  • 证明基于门控机制的预测学习能够有效从原始文本中学习潜在的实体类型信息。
  • 评估模型对知识库质量及实体词表中污染情况的鲁棒性。
  • 证明仅以困惑度作为唯一目标进行端到端训练,即可生成高质量的NER系统。

提出的方法

  • KALM在传统RNN语言模型基础上引入门控机制,根据上下文决定生成通用词汇或KB实体。
  • 模型使用实体类型嵌入来调节门控机制,使其能够预测下一个标记是否应为特定类型的命名实体。
  • 门控机制通过标准语言建模范式进行端到端训练——即最小化文本序列的困惑度。
  • 实体生成通过按类型划分的KB实现,模型根据上下文学习关注相关实体类型。
  • 推理阶段,利用模型预测的实体类型和生成概率,无监督地识别命名实体。
  • 通过引入实体类型上的先验概率P(τ|y)等额外解码策略,对模型进行微调,以提升NER性能。

实验结果

研究问题

  • RQ1仅基于文本困惑度进行训练的语言模型,能否在无任何监督的情况下识别命名实体?
  • RQ2与标准语言模型相比,KB增强型语言模型在提升语言建模困惑度方面效果如何?
  • RQ3知识库质量在多大程度上影响无监督NER系统的性能?
  • RQ4语言建模过程中学习到的潜在实体类型预测,能否用于构建具有竞争力的NER系统?
  • RQ5当在不同规模的标注数据上进行训练时,无监督KALM模型的性能与监督模型相比如何?

主要发现

  • KALM在标准语言建模基准上实现了新的最先进困惑度表现,优于传统语言模型。
  • 基础KALM模型在CoNLL-2003 NER基准上未使用任何标注数据即达到0.72的F1分数,证明了其在无监督学习中的有效性。
  • 在更大语料(CoNLL-2003 + WikiText-2)上进行训练,可将NER F1提升至0.84,表明大规模无监督学习的优势。
  • 最佳KALM模型达到0.86的F1分数,与仅使用40%训练数据的监督CRF-biLSTM模型性能相当。
  • 当KB出现污染,尤其是实体类型信息被移除时,模型的NER性能显著下降,表明其对KB质量较为敏感。
  • 在解码阶段引入先验概率P(τ|y)可使F1从0.84提升至0.86,证实了引入类型先验的有益作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。