Skip to main content
QUICK REVIEW

[论文解读] Using Chinese Glyphs for Named Entity Recognition

Arijit Sehanobish, Chan Hee Song|arXiv (Cornell University)|Sep 22, 2019
Topic Modeling参考文献 30被引用 6
一句话总结

本文提出了一种基于CNN的新方法,通过利用黑体字中汉字字形(字符)的视觉特征作为语义线索,提升中文命名实体识别(NER)性能,仅使用4,500个灰度64×64像素的黑体字字符。该方法在Weibo数据集上达到71.81的F1分数,在MSRA数据集上达到96.49的F1分数,优于BERT-BiLSTM-CRF基线模型最高达+0.72的F1分数,同时对非中文字符具有鲁棒性,且所需字形数据极少。

ABSTRACT

Most Named Entity Recognition (NER) systems use additional features like part-of-speech (POS) tags, shallow parsing, gazetteers, etc. Such kind of information requires external knowledge like unlabeled texts and trained taggers. Adding these features to NER systems have been shown to have a positive impact. However, sometimes creating gazetteers or taggers can take a lot of time and may require extensive data cleaning. In this paper for Chinese NER systems, we do not use these traditional features but we use lexicographic features of Chinese characters. Chinese characters are composed of graphical components called radicals and these components often have some semantic indicators. We propose CNN based models that incorporate this semantic information and use them for NER. Our models show an improvement over the baseline BERT-BiLSTM-CRF model. We set a new baseline score for Chinese OntoNotes v5.0 and show an improvement of +.64 F1 score. We present a state-of-the-art F1 score on Weibo dataset of 71.81 and show a competitive improvement of +0.72 over baseline on ResumeNER dataset.

研究动机与目标

  • 在不依赖外部特征(如词典或词性标注)的前提下,提升中文NER性能。
  • 探索利用中文字符字形(偏旁部首)中的视觉语义信息,作为低资源、鲁棒的NER特征。
  • 开发一种训练高效、易于实现的模型,将字形编码视为图像分类问题。
  • 评估模型在包含英文字符和未登录词等噪声输入下的鲁棒性。
  • 在主要中文NER基准上实现SOTA性能,且所需字形数据极少。

提出的方法

  • 该模型采用两种CNN架构——'步幅'(strided)和'GLYNN'——将中文字符字形编码为视觉特征,将字形表示视为计算机视觉任务。
  • 通过UTF-8码点从4,500个灰度64×64像素的黑体字字符字典中提取字形图像。
  • 将CNN学习到的字形特征与冻结的中文BERT嵌入的最后四层拼接,形成增强的字符级表示。
  • 将这些组合嵌入输入到BiLSTM-CRF解码器中进行序列标注,采用端到端训练方式,其中BERT保持冻结。
  • 使用自编码器对GLYNN模型进行预训练,以提升性能并减少开发集和测试集上的方差。
  • 在OntoNotes v5.0、Weibo、ResumeNER和MSRA数据集上评估系统,并对初始学习率、dropout率和训练轮数进行消融研究。

实验结果

研究问题

  • RQ1能否从中文字符字形中提取的视觉特征,在不依赖外部语言学特征的前提下提升NER性能?
  • RQ2与强大的BERT-BiLSTM-CRF基线相比,字形增强的NER模型在标准中文NER基准上的性能如何?
  • RQ3当模型暴露于缺乏语义意义的非中文字符(如英文字母)时,其鲁棒性如何?
  • RQ4需要多少字形数据才能实现有效性能?是否一个小型且一致的字体集合即可满足需求?
  • RQ5通过自编码器对字形编码器进行预训练,是否能带来可测量的NER性能提升和稳定性改善?

主要发现

  • 所提模型在Weibo数据集上实现了SOTA的F1分数71.81,较基线模型提升+0.72。
  • 在MSRA数据集上,模型达到SOTA的F1分数96.49,表明其在大规模、高质量NER基准上的强大性能。
  • 在中文OntoNotes v5.0数据集上,模型较基线提升+0.64 F1分数,证实其在多样化数据集上的持续增益。
  • 模型对非中文字符表现出鲁棒性:当将英文字母或未登录词作为字形输入时,性能仍优于基线模型。
  • 自编码器预训练步骤略微提升了性能并减少了方差,尤其在Weibo和OntoNotes数据集上效果显著。
  • 超参数调优表明,Weibo和OntoNotes数据集上30轮训练为最优,ResumeNER数据集上20轮为最优;训练超过30轮会导致性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。