Skip to main content
QUICK REVIEW

[论文解读] FLAT: Chinese NER Using Flat-Lattice Transformer

Xiaonan Li, Hang Yan|arXiv (Cornell University)|Apr 24, 2020
Topic Modeling参考文献 20被引用 12
一句话总结

FLAT 提出了一种用于中文命名实体识别的扁平化图注意力 Transformer 架构,将动态图结构转换为带有头尾位置编码的跨度集合,实现了完全并行化,并高效建模了字符级与词级信息。该方法在四个基准数据集上实现了最先进性能,并且推理速度优于以往基于词典的模型。

ABSTRACT

Recently, the character-word lattice structure has been proved to be effective for Chinese named entity recognition (NER) by incorporating the word information. However, since the lattice structure is complex and dynamic, most existing lattice-based models are hard to fully utilize the parallel computation of GPUs and usually have a low inference-speed. In this paper, we propose FLAT: Flat-LAttice Transformer for Chinese NER, which converts the lattice structure into a flat structure consisting of spans. Each span corresponds to a character or latent word and its position in the original lattice. With the power of Transformer and well-designed position encoding, FLAT can fully leverage the lattice information and has an excellent parallelization ability. Experiments on four datasets show FLAT outperforms other lexicon-based models in performance and efficiency.

研究动机与目标

  • 为解决现有基于图的中文命名实体识别模型中因依赖 RNN 或动态结构而导致的效率低下与长距离建模能力有限的问题。
  • 通过将图结构扁平化为带位置编码的跨度,实现 Transformer 模型在图结构输入上的完全并行化。
  • 在不依赖分词错误传播的前提下,有效整合字符级与词级信息。
  • 在中文命名实体识别基准测试中,同时在准确率与推理速度上超越现有基于词典的模型。

提出的方法

  • 将字符-词图结构转换为由跨度组成的扁平化结构,其中每个跨度代表一个字符或一个潜在词,并标注其起始(头)与结束(尾)位置。
  • 提出一种新颖的位置编码方案,利用头尾位置来在 Transformer 自注意力机制中保留图结构信息。
  • 在 Transformer 编码器中使用标准多头自注意力机制,使字符与所有潜在词(包括自匹配词)能够直接交互。
  • 使用预训练的 BERT 嵌入作为输入特征,以增强上下文表示与实体分类能力。
  • 在每个子层后应用残差连接与层归一化,遵循标准 Transformer 架构。
  • 使用交叉熵损失进行训练,并通过 CRF 解码进行序列标注,采用端到端优化。

实验结果

研究问题

  • RQ1扁平化图结构表示能否实现 Transformer 在中文命名实体识别任务中的高效、完全并行化训练?
  • RQ2所提出的头-尾位置编码是否能有效保留图结构信息,从而提升实体识别性能?
  • RQ3该模型能否在准确率与推理速度上同时超越基于图的 LSTM 模型与图神经网络模型?
  • RQ4在 FLAT 框架中,预训练 BERT 嵌入的引入对性能有何影响?

主要发现

  • FLAT 在四个中文命名实体识别数据集上达到最先进性能,在 F1 与准确率指标上均优于 BERT+CRF 及其他基于词典的模型。
  • 在 Ontonotes 数据集上,FLAT 相较基线 BERT+CRF 模型,Span F 提升 1.68 个百分点,Type Acc 提升 1.68 个百分点。
  • 在 MSRA 数据集上,FLAT 达到 Span F 96.09 与 Type Acc 95.86,显著优于 BERT 基线模型的 94.95 与 95.53。
  • 由于实现了全 GPU 并行化,FLAT 展现出更优的推理速度,而 lattice-LSTM 因依赖动态结构与顺序处理而效率受限。
  • 消融实验证实,头-尾位置编码至关重要,移除后性能显著下降,尤其在 Span F 指标上。
  • 在小规模数据集(如 Resume 与 Weibo)上,模型仅获得微小提升,表明图结构整合的优势在更大、更丰富的数据集上更为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。