Skip to main content
QUICK REVIEW

[论文解读] What do we Really Know about State of the Art NER?

Sowmya Vajjala, Ramya Balasubramaniam|arXiv (Cornell University)|Apr 29, 2022
Topic Modeling被引用 10
一句话总结

本文通过评估其在不同文本类型、对抗性扰动和分布外设置下的表现,对当前最先进的(SOTA)命名实体识别(NER)模型进行了批判性分析。基于一个广泛使用的数据集,作者使用三种SOTA模型揭示了在未见文本类型和对抗性样本上性能显著下降的现象,主张在NER研究中采用更全面的报告实践,以提升透明度和鲁棒性评估水平。

ABSTRACT

Named Entity Recognition (NER) is a well researched NLP task and is widely used in real world NLP scenarios. NER research typically focuses on the creation of new ways of training NER, with relatively less emphasis on resources and evaluation. Further, state of the art (SOTA) NER models, trained on standard datasets, typically report only a single performance measure (F-score) and we don't really know how well they do for different entity types and genres of text, or how robust are they to new, unseen entities. In this paper, we perform a broad evaluation of NER using a popular dataset, that takes into consideration various text genres and sources constituting the dataset at hand. Additionally, we generate six new adversarial test sets through small perturbations in the original test set, replacing select entities while retaining the context. We also train and test our models on randomly generated train/dev/test splits followed by an experiment where the models are trained on a select set of genres but tested genres not seen in training. These comprehensive evaluation strategies were performed using three SOTA NER models. Based on our results, we recommend some useful reporting practices for NER researchers, that could help in providing a better understanding of a SOTA model's performance in future.

研究动机与目标

  • 探究SOTA NER模型在标准基准评估之外的各类文本类型和领域中的泛化能力如何。
  • 评估SOTA NER模型在替换实体但保持上下文不变的对抗性扰动下的鲁棒性。
  • 评估模型在仅使用部分文本类型进行训练并在未见文本类型上进行测试时的表现,以模拟现实世界中的部署场景。
  • 识别当前NER评估实践中存在的缺陷,这些缺陷限制了对模型行为和可靠性的理解。
  • 提出改进的报告标准,以增强NER研究中模型性能评估的透明度和可比性。

提出的方法

  • 使用涵盖多种文本类型和来源的多样化数据集,对三种SOTA NER模型进行了全面评估。
  • 通过在原始测试集的实体上应用微小但保持上下文不变的扰动,生成了六个新的对抗性测试集。
  • 通过随机生成训练/验证/测试集划分,进行训练和测试,以评估在不同数据划分下的稳定性。
  • 在部分文本类型上进行模型训练,并在未见文本类型上进行评估,以测试其泛化能力。
  • 使用标准指标(如F1值),同时分析各类实体类型和文本类型的性能,以揭示隐藏的性能差异。
  • 不仅报告整体F1值,还按实体类型和文本类型报告结果,从而实现对模型行为的细粒度分析。

实验结果

研究问题

  • RQ1在单一数据集内的不同文本类型和来源中,SOTA NER模型的表现如何?
  • RQ2SOTA NER模型对替换命名实体但保持上下文不变的小型、上下文保持型扰动的鲁棒性如何?
  • RQ3当在训练过程中未见过的文本类型上进行测试时,模型性能如何下降?
  • RQ4当前的评估实践在多大程度上掩盖了SOTA NER模型的真实能力与局限性?
  • RQ5哪些报告实践可以提升NER模型评估的透明度和可靠性?

主要发现

  • 当在未见的文本类型上进行评估时,SOTA NER模型表现出显著的性能下降——有时F1值下降超过20个百分点,表明其泛化能力较差。
  • 在替换实体的对抗性测试集中,性能出现显著下降,部分模型的F1值最高下降15分,揭示了对微小输入变化的脆弱性。
  • 各类实体类型之间的性能差异巨大,低资源实体(如“Event”或“Title”)的召回率和F1值远低于高资源类型(如“Person”或“Location”)。
  • 随机划分训练/验证/测试集导致各次运行间性能不一致,凸显了在标准评估协议下评估的不稳定性。
  • 在部分文本类型上进行训练的模型在未见文本类型上表现不佳,凸显了对特定领域特征过拟合的风险。
  • 本研究表明,仅依赖整体F1值会提供一个不完整且常常具有误导性的模型能力图景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。