Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Contextualized Representation for Named Entity Recognition

Ying Luo, Fengshun Xiao|arXiv (Cornell University)|Nov 6, 2019
Topic Modeling参考文献 39被引用 13
一句话总结

本文提出了一种用于命名实体识别(NER)的层次化上下文表示模型,通过整合句子级和文档级表示,增强了基于BiLSTM的系统。它使用标签嵌入注意力机制来加权句子中词语的贡献,并采用键值记忆网络从训练实例中检索文档感知表示,从而在CoNLL-2003(无BERT时为91.96)、OntoNotes 5.0(87.98)和CoNLL-2002(87.08)上实现了最先进(SOTA)的F1分数。

ABSTRACT

Named entity recognition (NER) models are typically based on the architecture of Bi-directional LSTM (BiLSTM). The constraints of sequential nature and the modeling of single input prevent the full utilization of global information from larger scope, not only in the entire sentence, but also in the entire document (dataset). In this paper, we address these two deficiencies and propose a model augmented with hierarchical contextualized representation: sentence-level representation and document-level representation. In sentence-level, we take different contributions of words in a single sentence into consideration to enhance the sentence representation learned from an independent BiLSTM via label embedding attention mechanism. In document-level, the key-value memory network is adopted to record the document-aware information for each unique word which is sensitive to similarity of context information. Our two-level hierarchical contextualized representations are fused with each input token embedding and corresponding hidden state of BiLSTM, respectively. The experimental results on three benchmark NER datasets (CoNLL-2003 and Ontonotes 5.0 English datasets, CoNLL-2002 Spanish dataset) show that we establish new state-of-the-art results.

研究动机与目标

  • 解决BiLSTM在捕捉命名实体识别中全局句子和文档级上下文方面的局限性。
  • 通过利用上下文表示,提升模型在词汇表内、词汇表外及罕见命名实体上的性能。
  • 通过直接在推理中整合训练实例信息到记忆网络,提升模型泛化能力。
  • 开发一种基于标签特定嵌入加权句子中词语重要性的方法,以改善句子级表示。
  • 使模型能够从数据集级别的上下文中获益,而无需完全依赖预训练语言模型。

提出的方法

  • 引入一种标签嵌入注意力机制,通过计算词语嵌入与学习到的标签嵌入之间的相似性,生成置信度分数,从而加权句子级表示中词语的贡献。
  • 构建一个键值记忆网络,从训练实例中存储并检索文档级表示,使用余弦相似度作为兼容性函数。
  • 在CRF解码前,将句子级表示与输入词元嵌入融合,并将文档级表示与BiLSTM隐藏状态融合。
  • 采用平均池化和注意力池化策略,比较不同句子级表示方法的有效性。
  • 实现一种动态记忆查询机制,为每个唯一词语选择最多T个实例,以在覆盖范围与噪声之间取得平衡,尤其适用于高频词。
  • 在所有实验中保持一致的模型架构(IntNet、CRF、序列标注层),以确保与基线模型的公平比较。

实验结果

研究问题

  • RQ1通过基于标签语义对齐程度加权词语贡献,整合句子级上下文表示是否能提升NER性能?
  • RQ2从训练实例中提取的文档级表示是否能提升推理性能,特别是在罕见或词汇表外命名实体上?
  • RQ3与基线BiLSTM-CRF模型相比,同时整合句子级和文档级表示如何影响整体NER性能?
  • RQ4在记忆网络中检索相关文档级表示时,最优的兼容性函数(如余弦相似度、点积、缩放点积)是什么?
  • RQ5记忆子集大小(T)如何影响模型性能与推理效率?

主要发现

  • 所提模型在CoNLL-2003数据集上实现了91.96的新SOTA F1分数(无外部知识),优于先前的SOTA方法。
  • 在OntoNotes 5.0上,模型在无外部知识的情况下达到87.98的F1分数,表明其在多样化领域中的强大泛化能力。
  • 在CoNLL-2002上,模型达到87.08的F1分数,证实其在多语言和低资源NER设置下的有效性。
  • 与平均池化相比,标签嵌入注意力机制使F1提升0.25分,且余弦相似度优于点积和缩放点积。
  • 模型在词汇表内命名实体(IV)上F1提升0.39,在训练词汇表外(OOTV)命名实体上提升0.44,在双词汇表外(OOBV)命名实体上提升0.43,表明其对OOV挑战具有强鲁棒性。
  • 尽管引入了额外的记忆与计算开销,模型的训练时间仅比基线增加19%,显示出随记忆大小T的高效可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。