Skip to main content
QUICK REVIEW

[论文解读] A FOFE-based Local Detection Approach for Named Entity Recognition and Mention Detection

Mingbin Xu, Hui Jiang|arXiv (Cornell University)|Nov 2, 2016
Topic Modeling参考文献 11被引用 11
一句话总结

本文提出了一种基于FOFE的命名实体识别(NER)与提及检测的新型局部检测方法,将每个句子片段视为独立单元进行分类,利用固定大小的序数遗忘编码(FOFE)捕捉上下文信息。该方法在CoNLL 2003和TAC-KBP2015/2016 EDL任务中均表现出色,经系统融合后在三语KBP2016评估中F1得分为0.754。

ABSTRACT

In this paper, we study a novel approach for named entity recognition (NER) and mention detection in natural language processing. Instead of treating NER as a sequence labelling problem, we propose a new local detection approach, which rely on the recent fixed-size ordinally forgetting encoding (FOFE) method to fully encode each sentence fragment and its left/right contexts into a fixed-size representation. Afterwards, a simple feedforward neural network is used to reject or predict entity label for each individual fragment. The proposed method has been evaluated in several popular NER and mention detection tasks, including the CoNLL 2003 NER task and TAC-KBP2015 and TAC-KBP2016 Tri-lingual Entity Discovery and Linking (EDL) tasks. Our methods have yielded pretty strong performance in all of these examined tasks. This local detection approach has shown many advantages over the traditional sequence labelling methods.

研究动机与目标

  • 为解决传统序列标注在NER中应用的局限性,提出一种独立评估片段的局部检测框架。
  • 通过完全编码可变长度句子片段及其左右上下文,提升实体识别与提及检测性能。
  • 利用固定大小的序数遗忘编码(FOFE)方法,在不损失信息的前提下保留上下文信息,避免特征工程带来的信息损失。
  • 在多个基准NER与提及检测任务(包括CoNLL 2003和TAC-KBP2015/2016 EDL任务)中实现最先进性能。
  • 证明该方法在其他NLP任务(如POS标注、短语切分和语义解析)中的泛化能力。

提出的方法

  • 每个句子片段(最大长度限制内)被独立处理为实体识别的候选对象。
  • 应用固定大小的序数遗忘编码(FOFE)方法,将片段及其左右上下文编码为固定大小的向量表示。
  • 使用简单的前馈神经网络将每个片段分类为有效实体(带类别)或非实体。
  • 模型通过词嵌入与字符嵌入端到端训练,训练数据按90%训练集、5%验证集和5%测试集划分。
  • 对于多语言任务,使用word2vec在多语言语料库(如英语、中文、西班牙语Gigaword)上训练词嵌入。
  • 与Liu等人(2016)提出的CNN-RNN模型进行系统融合,显著提升了KBP2016 EDL赛道的性能,尤其在召回率方面。

实验结果

研究问题

  • RQ1基于FOFE编码的局部检测方法是否能在NER与提及检测中超越传统序列标注方法?
  • RQ2在NER任务中,FOFE在保留可变长度句子片段上下文信息方面效果如何?
  • RQ3结合多种训练数据源(如KBP2015、WIKI、iFLYTEK)对实体发现性能有何影响?
  • RQ4该方法在多种语言与实体类型(包括嵌套与名词性提及)上的泛化能力如何?
  • RQ5与CNN-RNN模型进行系统融合后,对多语言实体发现与链接任务的整体性能有何影响?

主要发现

  • 在KBP2016英语实体发现任务中,该方法在KBP2015与iFLYTEK数据上联合训练后,F1得分为0.731,优于仅使用单一数据源训练的模型。
  • 在KBP2016英语评估中,加入弱标签的维基百科数据(WIKI)后,F1得分从0.693提升至0.707。
  • 在官方KBP2016三语EDL评估中,系统整体F1得分为0.718,位列最强提交结果之中。
  • 与Liu等人(2016)的CNN-RNN模型进行系统融合后,F1得分进一步提升至0.754,召回率达0.735,表明两者具有互补优势。
  • 该方法在命名实体与名词性提及上均表现优异,在英语中名词性实体的召回率达0.336,在中文中为0.258。
  • 在英语中命名实体的F1得分为0.840,在中文中为0.768,表明其具备强大的跨语言泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。