Skip to main content
QUICK REVIEW

[论文解读] A Sequence-to-Set Network for Nested Named Entity Recognition

Zeqi Tan, Yongliang Shen|arXiv (Cornell University)|May 19, 2021
Topic Modeling参考文献 30被引用 5
一句话总结

本文提出一种用于嵌套命名实体识别(NER)的序列到集合网络,将实体预测视为无序集合生成任务,以克服序列到序列方法和基于跨度方法的局限性。通过使用可学习的实体查询以及带有自注意力机制的非自回归解码器,该模型捕捉了实体间的依赖关系,并在 ACE 2004、ACE 2005 和 KBP 2017 上实现了最先进性能,F1 分数最高优于先前方法 2.99%。

ABSTRACT

Named entity recognition (NER) is a widely studied task in natural language processing. Recently, a growing number of studies have focused on the nested NER. The span-based methods, considering the entity recognition as a span classification task, can deal with nested entities naturally. But they suffer from the huge search space and the lack of interactions between entities. To address these issues, we propose a novel sequence-to-set neural network for nested NER. Instead of specifying candidate spans in advance, we provide a fixed set of learnable vectors to learn the patterns of the valuable spans. We utilize a non-autoregressive decoder to predict the final set of entities in one pass, in which we are able to capture dependencies between entities. Compared with the sequence-to-sequence method, our model is more suitable for such unordered recognition task as it is insensitive to the label order. In addition, we utilize the loss function based on bipartite matching to compute the overall training loss. Experimental results show that our proposed model achieves state-of-the-art on three nested NER corpora: ACE 2004, ACE 2005 and KBP 2017. The code is available at https://github.com/zqtan1024/sequence-to-set.

研究动机与目标

  • 为解决序列到序列模型在嵌套 NER 中因自回归生成而对标签顺序敏感的局限性。
  • 通过用可学习的实体查询替代显式的跨度枚举,克服基于跨度方法中高搜索空间和跨度间缺乏交互的问题。
  • 将嵌套命名实体视为无序集合预测任务,实现端到端、单次通过的实体集合生成。
  • 通过实体查询之间的自注意力机制,捕捉实体间的依赖关系,从而提升性能。
  • 设计一种基于二分匹配的训练目标,相较于交叉熵损失,更适用于无序集合预测。

提出的方法

  • 模型使用序列编码器(BERT 或 BiLSTM)将输入文本编码为上下文表示。
  • 引入一组固定的可学习实体查询,用于表示潜在的实体,这些查询在训练过程中被更新,以学习有价值跨度的模式。
  • 非自回归解码器通过序列编码与实体查询之间的交叉注意力,在单次前向传播中预测最终的实体集合。
  • 实体查询之间的自注意力机制可直接建模预测实体之间的依赖关系。
  • 采用基于二分匹配的损失函数计算整体训练损失,实现预测实体集与真实实体集的对齐,而无需依赖标签顺序。
  • 模型通过二分匹配损失端到端训练,该损失函数相较于标准交叉熵损失,更适用于无序集合预测。

实验结果

研究问题

  • RQ1将嵌套 NER 视为序列到集合任务是否能通过避免序列到序列模型固有的标签顺序敏感性来提升性能?
  • RQ2可学习的实体查询是否能有效替代显式的跨度枚举,从而减少搜索空间,同时保持或提升准确率?
  • RQ3具有实体查询间自注意力机制的非自回归解码器是否比自回归或基于跨度的方法更好地捕捉实体间依赖关系?
  • RQ4二分匹配损失是否比交叉熵损失在训练嵌套 NER 的无序集合预测任务中更有效?
  • RQ5所提出的模型是否能在无需复杂预/后处理或易出错的跨度生成流水线的情况下,在多个嵌套 NER 基准上实现最先进性能?

主要发现

  • 所提模型在三个主要嵌套 NER 基准上均达到最先进 F1 分数:ACE 2004 为 87.26,ACE 2005 为 87.05,KBP 2017 为 85.75。
  • 在 ACE 2004 上优于强基线模型 0.56% 的 F1 分数,在 ACE 2005 上提升 1.65%,在 KBP 2017 上提升 2.99%。
  • 冻结实体查询后,ACE 2004 和 ACE 2005 的 F1 分数分别下降 0.40% 和 0.81%,表明其学习到了有意义的跨度模式。
  • 将交叉熵损失替换为二分匹配损失后,ACE 2004 的 F1 提升 2.67%,ACE 2005 提升 1.11%,证实其在无序集合预测中的有效性。
  • 消融实验表明,可学习的实体查询和二分匹配损失均为模型性能的关键组件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。