Skip to main content
QUICK REVIEW

[论文解读] Generalisation in Named Entity Recognition: A Quantitative Analysis

Isabelle Augenstein, Leon Derczynski|White Rose Research Online (University of Leeds, The University of Sheffield, University of York)|Jan 11, 2017
Topic Modeling参考文献 43被引用 4
一句话总结

本文对命名实体识别(NER)在不同文本类型中的泛化挑战进行了定量分析,发现未见命名实体和未登录词(OOV)特征显著降低了F1分数,尤其在社交媒体和网页内容中表现明显。研究显示,最先进的NER模型,特别是依赖表面形式记忆的模型,在训练数据之外的泛化能力较差,其中SENNA因使用词嵌入表现最佳,而性能与未见命名实体的比例相关性最强,而非语料库大小或特征稀疏性。

ABSTRACT

Named Entity Recognition (NER) is a key NLP task, which is all the more challenging on Web and user-generated content with their diverse and continuously changing language. This paper aims to quantify how this diversity impacts state-of-the-art NER methods, by measuring named entity (NE) and context variability, feature sparsity, and their effects on precision and recall. In particular, our findings indicate that NER approaches struggle to generalise in diverse genres with limited training data. Unseen NEs, in particular, play an important role, which have a higher incidence in diverse genres such as social media than in more regular genres such as newswire. Coupled with a higher incidence of unseen features more generally and the lack of large training corpora, this leads to significantly lower F1 scores for diverse genres as compared to more regular ones. We also find that leading systems rely heavily on surface forms found in training data, having problems generalising beyond these, and offer explanations for this observation.

研究动机与目标

  • 许多NER系统在面对社交媒体等用户生成内容时难以泛化,原因在于语言变异和未见实体。
  • 现有研究缺乏对实体多样性、上下文可变性以及OOV特征如何影响不同文本类型中NER性能的定量分析。
  • 本研究旨在识别在低资源、多样化语料中跨领域NER性能下降的主要驱动因素。
  • 研究人员旨在评估训练数据表面形式的记忆是否解释了泛化能力差的问题,并探讨更大规模或领域自适应的训练数据是否能缓解此问题。
  • 理解未见命名实体和特征的作用对于提升现实世界NLP应用的鲁棒性至关重要。

提出的方法

  • 实验比较了三种最先进的NER系统——Stanford NER、SENNA和CRFSuite——在六个基准语料库上的表现,涵盖新闻报道、广播新闻、博客、电话语音和Usenet等。
  • 语料库包括多种类型,如CoNLL(新闻报道)、MUC-7(新闻报道)、ACE(多类型)、OntoNotes(多类型)、Ritter Twitter和MSM 2013,确保广泛覆盖。
  • 性能通过F1分数、精确率和召回率进行评估,重点关注未见命名实体和OOV特征。
  • 未见命名实体定义为在测试集中出现但未在训练集中出现的实体;OOV特征指在训练期间未见过的词汇或句法特征。
  • 使用记忆基线来预测性能,方法是为每个在训练中观察到的词元序列选择最频繁的NE标签。
  • 语料库分析量化了实体多样性、上下文可变性和特征稀疏性,以与系统性能进行相关性分析。

实验结果

研究问题

  • RQ1RQ1:在不同NER方法对多样化语料库的NER性能表现有何差异?
  • RQ2RQ2:NER性能在不同文本类型和语料库之间如何变化?
  • RQ3RQ3:命名实体多样性对系统性能有何影响?
  • RQ4RQ4:OOV特征、OOV实体与F1分数之间存在何种关系?
  • RQ5RQ5:NER方法在跨领域场景下的泛化能力如何?未见命名实体对性能有何影响?

主要发现

  • SENNA在所有语料库中均取得最高的F1分数,优于Stanford NER和CRFSuite,主要得益于其基于深度学习的词嵌入技术。
  • 尽管OntoNotes NW在命名实体数量上是最大的语料库,但其F1分数低于CoNLL,表明语料库大小本身并不能保证更好的性能。
  • 未见命名实体比例越高的语料库,F1分数显著越低,所有模型在未见实体上的性能比在已见实体上低约17个百分点。
  • CoNLL新闻报道语料库取得最高F1分数,因其未见命名实体比例最低,证实实体多样性是性能的关键预测因子。
  • 记忆基线——即为每个词元序列预测最频繁的NE标签——能强有力预测系统准确率,表明模型严重依赖记忆训练数据的表面形式。
  • 除非跨领域记忆基线优于领域内记忆基线,否则跨领域训练会导致性能显著下降,表明领域对齐对泛化至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。