Skip to main content
QUICK REVIEW

[论文解读] Boosting Named Entity Recognition with Neural Character Embeddings

Cícero Nogueira dos Santos, Victor Guimarães|arXiv (Cornell University)|May 19, 2015
Topic Modeling被引用 7
一句话总结

本文提出了一种基于CharWNN的与语言无关的命名实体识别(NER)系统,CharWNN是一种深度神经网络,能够联合学习词级别和字符级别的嵌入表示,用于序列分类。该系统不依赖人工特征,在HAREM I(葡萄牙语)语料库上取得了77.93的F1分数,在SPA CoNLL-2002(西班牙语)语料库上取得了82.21的F1分数,分别比先前最优系统在总体和选择性场景下高出7.9分和7.2分。

ABSTRACT

Most state-of-the-art named entity recognition (NER) systems rely on handcrafted features and on the output of other NLP tasks such as part-of-speech (POS) tagging and text chunking. In this work we propose a language-independent NER system that uses automatically learned features only. Our approach is based on the CharWNN deep neural network, which uses word-level and character-level representations (embeddings) to perform sequential classification. We perform an extensive number of experiments using two annotated corpora in two different languages: HAREM I corpus, which contains texts in Portuguese; and the SPA CoNLL-2002 corpus, which contains texts in Spanish. Our experimental results shade light on the contribution of neural character embeddings for NER. Moreover, we demonstrate that the same neural network which has been successfully applied to POS tagging can also achieve state-of-the-art results for language-independet NER, using the same hyperparameters, and without any handcrafted features. For the HAREM I corpus, CharWNN outperforms the state-of-the-art system by 7.9 points in the F1-score for the total scenario (ten NE classes), and by 7.2 points in the F1 for the selective scenario (five NE classes).

研究动机与目标

  • 开发一种完全依赖自动学习特征的与语言无关的NER系统。
  • 探究神经字符嵌入对NER性能的贡献。
  • 评估单一深度神经网络架构(此前用于词性标注)是否可在相同超参数设置下实现最先进的NER性能。
  • 评估无监督预训练词嵌入对低资源和高资源语料中NER性能的影响。
  • 通过在两种不同语言(葡萄牙语,HAREM I;西班牙语,SPA CoNLL-2002)上的实验,评估模型的泛化能力。

提出的方法

  • CharWNN模型使用一个深度神经网络,处理以目标词为中心的固定窗口内的词序列,用于序列分类。
  • 词级别嵌入通过查找表学习,捕捉句法和语义信息;字符级别嵌入则通过卷积层从字符序列中提取。
  • 通过在字符嵌入上应用卷积层,再经过最大池化操作,生成与词长无关的固定大小向量,从而获得字符级别表示。
  • 网络的最终输入是词级别和字符级别嵌入的拼接,形成每个词的复合表示。
  • 模型采用结构化预测方法,使用Viterbi算法解码最可能的命名实体标签序列。
  • 通过大规模未标注文本对词嵌入进行无监督预训练,以提升泛化能力,尤其是在低资源设置下。

实验结果

研究问题

  • RQ1与仅使用词级别嵌入相比,神经字符嵌入在多大程度上提升了NER性能?
  • RQ2是否可以将此前用于词性标注训练的单一深度神经网络架构,无需任何人工特征,有效迁移至NER任务并实现最先进性能?
  • RQ3无监督预训练词嵌入对NER性能有何影响,特别是在低资源设置(如HAREM I语料库)下?
  • RQ4所提出的模型是否能在不同语言间实现泛化,如在葡萄牙语和西班牙语语料库上的表现所示?
  • RQ5字符级别表示对召回率的提升有何贡献,特别是在罕见或复杂命名实体(如组织名)方面?

主要发现

  • 在HAREM I语料库(葡萄牙语)的选择性场景下,CharWNN取得了77.93的最先进F1分数,比先前最先进系统高出7.2分。
  • 在总体场景(十类命名实体)下,CharWNN在HAREM I上的F1得分为71.41,比先前最先进系统高出7.9分。
  • 在SPA CoNLL-2002语料库(西班牙语)上,CharWNN取得了82.21的F1分数,是该语料库在无手工特征条件下报告的最高结果。
  • 无监督预训练的影响在HAREM I语料库上更为显著(F1提升13.2分),远高于SPA CoNLL-2002(F1提升4.3分),这可能是因为HAREM I的训练规模更小。
  • 与ETL CMT系统相比,CharWNN在HAREM I的ORG类别上实现了21分的召回率提升,表明其在罕见或复杂实体上的强大泛化能力。
  • 该模型表现出强鲁棒性和可迁移性,在使用相同超参数且无任何手工特征的情况下,成功实现了葡萄牙语和西班牙语NER的最先进结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。