Skip to main content
QUICK REVIEW

[论文解读] FGN: Fusion Glyph Network for Chinese Named Entity Recognition

Zhenyu Xuan, Rui Bao|arXiv (Cornell University)|Jan 15, 2020
Topic Modeling参考文献 20被引用 10
一句话总结

FGN,一种用于中文命名实体识别的新颖融合字形网络,通过自定义的CGS-CNN和切片注意力机制,将字形级别的视觉特征与上下文Bert表示进行融合。通过使用滑动窗口将字符级别的字形模式与上下文嵌入进行融合,FGN在四个中文命名实体识别基准上实现了最先进性能,证明了显式字形建模在自然语言处理中的价值。

ABSTRACT

Chinese NER is a challenging task. As pictographs, Chinese characters contain latent glyph information, which is often overlooked. In this paper, we propose the FGN, Fusion Glyph Network for Chinese NER. Except for adding glyph information, this method may also add extra interactive information with the fusion mechanism. The major innovations of FGN include: (1) a novel CNN structure called CGS-CNN is proposed to capture both glyph information and interactive information between glyphs from neighboring characters. (2) we provide a method with sliding window and Slice-Attention to fuse the BERT representation and glyph representation for a character, which may capture potential interactive knowledge between context and glyph. Experiments are conducted on four NER datasets, showing that FGN with LSTM-CRF as tagger achieves new state-of-the-arts performance for Chinese NER. Further, more experiments are conducted to investigate the influences of various components and settings in FGN.

研究动机与目标

  • 为解决中文命名实体识别中视觉字形信息利用不足的问题。
  • 通过显式建模相邻字符字形结构之间的交互,提升上下文表征能力。
  • 通过可学习的融合机制,将Bert的上下文嵌入与低层次字形特征进行整合。
  • 证明视觉字形模式包含对中文命名实体识别具有意义且互补的信号,超越纯语言上下文。

提出的方法

  • 提出一种新颖的CNN架构CGS-CNN,专用于从相邻字符中提取局部字形特征及字符间交互模式。
  • 引入滑动窗口机制,在保留字形结构空间特性的前提下捕捉字符间的上下文依赖。
  • 采用切片注意力模块,动态融合基于Bert的上下文表征与字形表征,实现字符级别的特征融合。
  • 采用晚期融合策略,在条件随机场(CRF)层之前将字形特征与上下文特征进行结合,以优化序列标注。
  • 在多个网络层上应用融合机制,实现视觉与语言信号的分层整合。
  • 使用交叉熵损失进行训练,并通过CRF解码实现序列级别的优化。

实验结果

研究问题

  • RQ1显式建模中文字符字形是否能超越标准Bert模型,在中文命名实体识别中提升性能?
  • RQ2对相邻字符字形特征的交互建模在提升实体识别能力方面有多有效?
  • RQ3当字形级别特征与上下文Bert表征融合时,其对中文命名实体识别的贡献如何?
  • RQ4不同融合策略(如注意力机制与拼接)对最终性能的影响如何?
  • RQ5窗口大小与注意力机制的变化如何影响模型捕捉局部字形-上下文交互的能力?

主要发现

  • FGN在四个主要中文命名实体识别数据集上实现了新的最先进性能,优于以往的SOTA模型。
  • 通过CGS-CNN整合字形特征,在所有四个数据集上均实现稳定提升,证实了视觉模式的有效性。
  • 切片注意力机制有效实现了Bert与字形表征的融合,消融实验表明其对性能提升有显著贡献。
  • 滑动窗口机制增强了局部上下文建模能力,尤其对具有复杂字形结构的罕见或生僻字符效果显著。
  • 消融实验证实,CGS-CNN与融合机制均为关键组件,任一移除均导致性能下降。
  • 由于字形特征带来的归纳偏置,模型在多种实体类型(包括罕见和OOV实体)上表现出强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。