Skip to main content
QUICK REVIEW

[论文解读] Fine-Grained Named Entity Recognition using ELMo and Wikidata

Cihan Dogan, Aimore Resende Riquetti Dutra|arXiv (Cornell University)|Apr 23, 2019
Topic Modeling参考文献 26被引用 9
一句话总结

本文提出了一种细粒度命名实体识别(FgNER)框架,结合ELMo上下文嵌入与Wikidata,将实体提及分类为112种详细类型。通过利用Wikidata的层次化分类体系和余弦相似度进行类型聚类,该模型在Wiki(黄金标准)数据集上无需直接微调即可实现52.8%的F1分数,展示了在多样化领域中强大的零样本泛化能力。

ABSTRACT

Fine-grained Named Entity Recognition is a task whereby we detect and classify entity mentions to a large set of types. These types can span diverse domains such as finance, healthcare, and politics. We observe that when the type set spans several domains the accuracy of the entity detection becomes a limitation for supervised learning models. The primary reason being the lack of datasets where entity boundaries are properly annotated, whilst covering a large spectrum of entity types. Furthermore, many named entity systems suffer when considering the categorization of fine grained entity types. Our work attempts to address these issues, in part, by combining state-of-the-art deep learning models (ELMo) with an expansive knowledge base (Wikidata). Using our framework, we cross-validate our model on the 112 fine-grained entity types based on the hierarchy given from the Wiki(gold) dataset.

研究动机与目标

  • 解决在处理大规模、多领域类型集合时细粒度NER准确率低下的挑战。
  • 通过利用Wikidata作为结构化、分层的实体类型来源,减少对昂贵人工标注的依赖。
  • 通过结合上下文嵌入与知识库链接,提升零样本泛化能力。
  • 实现可扩展、可迁移的FgNER,可在无需重新训练的情况下适配新领域。
  • 在基于Wikipedia和Wikidata构建的112种类型层级上评估模型性能。

提出的方法

  • 该模型使用ELMo嵌入来编码文本中实体提及的上下文表示。
  • 其应用多标签分类头以预测粗粒度的实体类型(例如:人物、地点、组织)。
  • 对于细粒度分类,通过实体链接将预测类型映射到Wikidata,并利用实体描述的余弦相似度进行聚类。
  • 聚类过程使用Wikipedia上的Word2Vec嵌入,计算实体描述与可能子类型的相似度。
  • 应用0.1的余弦相似度阈值以过滤合理的子类型映射,选择得分最高的匹配项。
  • 该框架避免在Wiki(黄金标准)数据集上直接进行训练,而是依赖预训练嵌入和外部知识实现零样本推理。

实验结果

研究问题

  • RQ1基于ELMo的上下文嵌入结合Wikidata是否能提升细粒度NER中的零样本性能?
  • RQ2Wikidata的层次化结构在实现实体提及的准确、自动子类型分类方面有多有效?
  • RQ3使用实体描述与Wikidata子类型之间的余弦相似度是否优于启发式或基于规则的聚类方法?
  • RQ4当未在该特定数据集上进行微调时,模型在112种类型层级上的表现如何?
  • RQ5在仅访问Wikidata和上下文嵌入的前提下,该框架是否能实现无需重新训练的跨领域泛化?

主要发现

  • 该模型在112种类型的Wiki(黄金标准)数据集上实现了52.8%的F1分数,展示了强大的零样本性能。
  • 在OntoNotes数据集上,该模型取得了88.7%的F1分数,表明其在更广泛、更粗粒度类别上的优异表现。
  • 表现最好的类别是组织(F1: 85%),而艺术类的F1为0%,表明在罕见或模糊类型上的细粒度分类仍具挑战。
  • 该模型在人物(F1: 66%)和地点(F1: 54%)类别上表现最佳,表明其与Wikidata结构对这些类型具有更好的对齐性。
  • 该框架在Wiki(黄金标准)数据集上优于先前系统(如Link et al., 2012),无需直接调优,F1分数达到52.8% vs. 53.2%。
  • 基于Word2Vec嵌入的余弦相似度聚类方法成功地将实体映射到子类型,尤其在人物、地点和组织类别上表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。