Skip to main content
QUICK REVIEW

[论文解读] Discontinuous Named Entity Recognition as Maximal Clique Discovery

Yucheng Wang, Bowen Yu|arXiv (Cornell University)|Jun 1, 2021
Topic Modeling参考文献 32被引用 4
一句话总结

本文提出 Mac,一种新颖的命名实体识别模型,将不连续 NER 问题重新表述为在片段图中的最大团发现问题,其中节点代表候选片段,边连接属于同一实体的片段。通过在单阶段内采用二维网格标注方案联合学习片段抽取与边预测,Mac 消除了暴露偏差,并在性能上达到最先进水平,F1 分数最高提升 3.5 个百分点,推理速度提升 5 倍,优于以往方法。

ABSTRACT

Named entity recognition (NER) remains challenging when entity mentions can be discontinuous. Existing methods break the recognition process into several sequential steps. In training, they predict conditioned on the golden intermediate results, while at inference relying on the model output of the previous steps, which introduces exposure bias. To solve this problem, we first construct a segment graph for each sentence, in which each node denotes a segment (a continuous entity on its own, or a part of discontinuous entities), and an edge links two nodes that belong to the same entity. The nodes and edges can be generated respectively in one stage with a grid tagging scheme and learned jointly using a novel architecture named Mac. Then discontinuous NER can be reformulated as a non-parametric process of discovering maximal cliques in the graph and concatenating the spans in each clique. Experiments on three benchmarks show that our method outperforms the state-of-the-art (SOTA) results, with up to 3.5 percentage points improvement on F1, and achieves 5x speedup over the SOTA model.

研究动机与目标

  • 解决现有不连续 NER 模型依赖顺序多阶段预测流程所导致的暴露偏差问题。
  • 提升对重叠及不连续实体提及的识别能力,尤其在临床和复杂文本中。
  • 消除顺序模型在训练时(使用黄金中间结果)与推理时(使用模型预测输出)之间的差异。
  • 开发一种在单阶段内联合学习片段边界与实体连接性的方法,避免错误传播。
  • 与最先进模型相比,实现更高的准确率和更快的推理速度。

提出的方法

  • 为每句话构建一个片段图,其中每个节点代表一个候选片段(连续或不连续实体的一部分),边连接属于同一实体的片段。
  • 采用二维网格标注方案,在单阶段内独立预测片段边界(片段抽取)与片段间连接(边预测)。
  • 将片段抽取建模为标签任务,通过为 token 对分配标签来识别片段边界,从而支持重叠和不连续片段的检测。
  • 将边预测建模为同一实体边界 token 的对齐,利用网格上的可学习注意力机制捕捉长距离依赖。
  • 将最终的 NER 任务重新表述为在构建图中的非参数最大团发现问题,其中每个团对应一个完整的实体提及。
  • 使用贪心或精确的最大团检测算法从图中提取所有有效实体,确保无重叠且覆盖最大化。

实验结果

研究问题

  • RQ1不连续 NER 是否可被有效重述为基于图的最大团发现问题?
  • RQ2在单阶段内联合学习片段边界与实体连接是否能消除顺序模型中的暴露偏差?
  • RQ3与顺序流水线相比,2D 网格标注框架是否能更有效地联合建模重叠和不连续片段?
  • RQ4所提出的 Mac 模型是否在不连续 NER 基准测试中实现更优的性能与效率?
  • RQ5Mac 在不连续提及中区间长度与片段长度变化时是否表现出强鲁棒性?

主要发现

  • Mac 在三个不连续 NER 基准测试中达到最先进性能,相比之前最先进模型,F1 分数最高提升 3.5 个百分点。
  • 在 CADEC 数据集上,Mac 相较于之前最佳结果 F1 提升 3.5 个百分点,表明其在临床文本中具有强大有效性。
  • Mac 实现 5 倍推理速度提升,在 Tesla V100 GPU 上每秒可处理 193.3 个句子,而最先进模型 Trans E 仅为每秒 36.3 个句子。
  • 该模型在不同片段长度与区间长度下均保持高性能,多数设置下表现一致更优,尤其在长片段与大区间情况下优势明显。
  • 当区间长度为 1 且片段长度为 3 时,Mac 仍表现出鲁棒性,尽管性能略有下降,表明其在罕见极端情况下的挑战性。
  • 消融实验确认,通过 2D 网格标注方案实现的联合学习至关重要,因其消除了暴露偏差并支持端到端优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。