Skip to main content
QUICK REVIEW

[论文解读] Learning Named Entity Tagger using Domain-Specific Dictionary

Jingbo Shang, Liyuan Liu|arXiv (Cornell University)|Sep 10, 2018
Topic Modeling被引用 9
一句话总结

该论文提出 AutoNER,一种新颖的神经模型,用于弱监督命名实体识别,仅使用领域特定词典而无需人工标注数据。通过引入一种‘绑定或拆分’(Tie or Break)标签方案,模型能够稳健地建模实体跨度边界,即使在标签噪声较大的情况下依然表现优异。AutoNER 在三项基准数据集上超越了现有方法,并在性能上与监督基线模型相当。

ABSTRACT

Recent advances in deep neural models allow us to build reliable named entity recognition (NER) systems without handcrafting features. However, such methods require large amounts of manually-labeled training data. There have been efforts on replacing human annotations with distant supervision (in conjunction with external dictionaries), but the generated noisy labels pose significant challenges on learning effective neural models. Here we propose two neural models to suit noisy distant supervision from the dictionary. First, under the traditional sequence labeling framework, we propose a revised fuzzy CRF layer to handle tokens with multiple possible labels. After identifying the nature of noisy labels in distant supervision, we go beyond the traditional framework and propose a novel, more effective neural model AutoNER with a new Tie or Break scheme. In addition, we discuss how to refine distant supervision for better NER performance. Extensive experiments on three benchmark datasets demonstrate that AutoNER achieves the best performance when only using dictionaries with no additional human effort, and delivers competitive results with state-of-the-art supervised benchmarks.

研究动机与目标

  • 解决在低资源领域构建高精度命名实体识别系统所面临的挑战,因为人工标注成本高且耗时长。
  • 克服弱监督方法的局限性,后者由于词典覆盖不全和实体跨度模糊而产生噪声标签。
  • 开发一种神经模型,能够有效利用不完美的、基于词典的标签,而无需额外的人工标注数据。
  • 通过挖掘高质量的词典外短语并将其作为具有‘未知’类型的潜在实体,改进弱监督方法,从而提升命名实体识别性能。
  • 设计一种新型标签方案和神经架构,使其对标签噪声更具鲁棒性,并更好地利用实体提及的结构特征。

提出的方法

  • 提出一种模糊 LSTM-CRF 模型,将标准 CRF 层扩展为允许多标签分配,以处理因词典匹配重叠而产生的模糊性。
  • 引入一种新颖的‘绑定或拆分’标签方案,用于预测相邻词是否属于同一实体提及(绑定)或不属于(拆分),从而提升对边界噪声的鲁棒性。
  • 在 AutoNER 中设计一种两阶段神经架构:首先检测相邻词之间的绑定关系以形成候选跨度,然后对每个跨度进行类型分类。
  • 通过从语料库中挖掘高质量的词典外短语并将其标记为具有‘未知’类型的潜在实体,来优化弱监督过程,从而减少假阴性错误。
  • 使用扩展词典(包含挖掘出的短语)进行精确字符串匹配以生成初始标签,并通过最大化匹配总词数来解决冲突。
  • 使用交叉熵损失和反向传播端到端训练模型,其中‘绑定或拆分’方案有助于在噪声监督下实现更好的泛化能力。

实验结果

研究问题

  • RQ1仅使用领域特定词典且无任何人工标注训练数据,神经模型能否实现强大的命名实体识别性能?
  • RQ2与传统序列标注相比,‘绑定或拆分’标签方案在弱监督产生的噪声标签下,如何提升模型的鲁棒性?
  • RQ3在弱监督设置下,挖掘高质量的词典外短语在多大程度上能提升命名实体识别性能?
  • RQ4AutoNER 与依赖昂贵人工标注的监督基线模型相比表现如何?
  • RQ5通过词典扩展和短语挖掘来优化弱监督,对整体命名实体识别性能有何影响?

主要发现

  • 当仅使用基于词典的弱监督进行训练且无任何人工标注数据时,AutoNER 在三项基准数据集(BC5CDR、NCBI 和 BioCreative)上均取得了最高的 F1 分数。
  • Fuzzy-LSTM-CRF 模型作为强基线,但 AutoNER 显著优于它,证明了新‘绑定或拆分’方案的有效性。
  • 将挖掘出的词典外短语作为‘未知’类型实体引入后,可减少假阴性错误并提升整体性能,该结论通过消融实验得到验证。
  • AutoNER 的性能与依赖大规模人工标注的最先进监督模型相当,证明了仅使用词典训练的可行性。
  • 消融实验确认,‘绑定或拆分’方案以及通过短语挖掘优化的弱监督(即精炼的弱监督)对实现最优性能均至关重要。
  • 模型在不同领域间泛化能力良好,如在生物医学(BC5CDR、NCBI)和通用领域(笔记本评论)数据集上均表现出一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。