Skip to main content
QUICK REVIEW

[论文解读] MFE-NER: Multi-feature Fusion Embedding for Chinese Named Entity Recognition

Jiatong Li, Kui Meng|arXiv (Cornell University)|Sep 16, 2021
Topic Modeling参考文献 14被引用 10
一句话总结

本文提出 MFE-NER,一种用于中文命名实体识别的多特征融合嵌入方法,通过整合语义、字形和语音特征,解决字符替换问题。通过利用 'Five-Strokes' 进行结构编码,以及采用新颖的 'Trans-pinyin' 系统实现语音相似性计算,MFE 在非正式语言和替换语言场景中显著提升命名实体识别性能,在五个基准数据集上优于标准预训练模型。

ABSTRACT

In Chinese Named Entity Recognition, character substitution is a complicated linguistic phenomenon. Some Chinese characters are quite similar as they share the same components or have similar pronunciations. People replace characters in a named entity with similar characters to generate a new collocation but referring to the same object. As a result, it always leads to unrecognizable or mislabeling errors in the NER task. In this paper, we propose a lightweight method, MFE-NER, which fuses glyph and phonetic features, to help pre-trained language models handle the character substitution problem in the NER task with limited extra cost. Basically, in the glyph domain, we disassemble Chinese characters into Five-Stroke components to represent structure features. In the phonetic domain, an improved phonetic system is proposed in our work, making it reasonable to describe phonetic similarity among Chinese characters. Experiments demonstrate that our method performs especially well in detecting character substitutions while slightly improving the overall performance of Chinese NER.

研究动机与目标

  • 为解决中文命名实体识别中因字形或发音相似而被替换的挑战,即字符被替换以逃避检测或出于风格效果。
  • 提升预训练语言模型在非正式和动态语言环境(如社交媒体)中的鲁棒性,此类环境中字符替换现象普遍。
  • 将非语义语言特征——字形结构与发音——整合进神经命名实体识别模型,以增强泛化能力并减少识别错误。
  • 开发一种轻量化、可解释且可扩展的中文字符表示方法,捕捉语义嵌入之外的结构与语音相似性。

提出的方法

  • MFE-NER 融合三类嵌入:语义嵌入(来自类似 BERT 的预训练模型)、字形嵌入(使用 'Five-Strokes' 编码表示字形部件)和语音嵌入(通过基于国际音标的新颖 'Trans-pinyin' 系统实现)。
  • 'Five-Strokes' 方法将汉字分解为基于笔画的部件,以编码结构相似性,使字形相近的字符具有接近的向量表示。
  • 'Trans-pinyin' 系统将汉字映射到标准化的语音符号,实现字符间语音相似性的有意义计算。
  • 通过使用多个 LSTM 的后期交互策略进行特征融合,各模态分别处理后取平均预测结果,避免特征混合导致的过拟合。
  • 模型在包含原始与替换命名实体对的数据集上进行微调,模拟对比学习,以提升对替换模式的敏感性。
  • 使用线性层组合三个模态专用 LSTM 的输出,实现端到端训练,同时保持特征独立性。

实验结果

研究问题

  • RQ1将字形与语音特征整合是否能提升预训练语言模型在字符替换场景下识别中文命名实体的鲁棒性?
  • RQ2'Five-Strokes' 编码方法在捕捉汉字间结构相似性方面,相较于 'Four-Corner' 等现有方法表现如何?
  • RQ3标准化语音系统如 'Trans-pinyin' 在建模中文命名实体识别中的基于发音的替换方面,能提升多大程度?
  • RQ4语义、字形与语音特征的多模态融合是否在非正式和动态语言数据上优于仅使用语义的模型?

主要发现

  • MFE-NER 在五个基准数据集上显著提升整体命名实体识别性能,表现出对基线模型的一致性优势。
  • 模型在字符替换普遍存在的非正式语言环境中表现更优,表明其对语言变异具有更强的鲁棒性。
  • 分别使用 LSTM 处理由各特征模态生成的表示,并对预测结果取平均,相比通过线性层进行早期融合,能获得更好的泛化能力,减少过拟合。
  • 'Five-Strokes' 编码方法为传统编码系统提供了更具表现力且可扩展的替代方案,其空间复杂度低于基于图像的表示方法。
  • 'Trans-pinyin' 系统实现了准确的语音相似性计算,在捕捉基于发音的替换方面优于现有语音嵌入方法。
  • 通过原始-替换对进行对比学习,模型识别替换命名实体的能力得到增强,证明了多特征融合在应对语言变异中的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。