Skip to main content
QUICK REVIEW

[论文解读] Morphological Embeddings for Named Entity Recognition in Morphologically Rich Languages

Onur Güngör, Eray Yıldız|arXiv (Cornell University)|Jun 1, 2017
Topic Modeling参考文献 29被引用 8
一句话总结

本文提出了一种新颖的形态嵌入框架,通过将形态分析整合到神经序列模型中,提升了像土耳其语和捷克语这类形态丰富的语言中的命名实体识别(NER)性能。通过结合字符级嵌入与基于双向LSTM的形态嵌入,该方法在土耳其语上实现了93.59%的SOTA F1分数,在捷克语上实现了79.59%的SOTA F1分数,优于依赖手工特征或简单嵌入的先前方法。

ABSTRACT

In this work, we present new state-of-the-art results of 93.59,% and 79.59,% for Turkish and Czech named entity recognition based on the model of (Lample et al., 2016). We contribute by proposing several schemes for representing the morphological analysis of a word in the context of named entity recognition. We show that a concatenation of this representation with the word and character embeddings improves the performance. The effect of these representation schemes on the tagging performance is also investigated.

研究动机与目标

  • 通过将形态分析整合到神经序列模型中,提升形态丰富的语言中的命名实体识别性能。
  • 研究不同形态嵌入配置对NER性能的影响。
  • 对比形态嵌入与字符级嵌入及其组合的有效性。
  • 通过端到端深度学习与结构化的形态表示,为土耳其语和捷克语NER建立新的SOTA基准。

提出的方法

  • 该模型在Lample等人(2016)的NER框架基础上扩展,引入了通过在形态标签上训练的双向LSTM网络生成的形态嵌入。
  • 形态嵌入通过使用双向LSTM对每个词的形态标签序列(例如词性、格、时态)进行编码生成。
  • 最终的词表示通过拼接预训练的词嵌入、通过字符上的双向LSTM生成的字符级嵌入以及形态嵌入构成。
  • 系统使用双向LSTM建模从左到右和从右到左的上下文,随后通过全连接层和CRF进行序列标注。
  • 评估了多种形态嵌入配置,包括基于词根(WR)、词形(WOR)和字符级形态分析(CHAR)的表示。
  • 在土耳其语和捷克语数据集上进行实验,性能通过标准CoNLL风格测试集上的F1分数进行衡量。

实验结果

研究问题

  • RQ1在像土耳其语和捷克语这样的形态丰富的语言中,整合形态嵌入在多大程度上提升了NER性能?
  • RQ2基于词根、词形或字符的哪种形态嵌入配置性能最高?
  • RQ3在相同的NER框架中,形态嵌入与字符级嵌入相比,有效性如何?
  • RQ4形态嵌入在多大程度上能替代或补充字符级嵌入以提升NER准确率?

主要发现

  • 所提出的方法在土耳其语NER上实现了93.59%的新SOTA F1分数,超越了先前使用手工特征或简单嵌入的方法。
  • 在捷克语上,该模型实现了79.59%的F1分数,相较于先前工作(包括使用外部词典或基于CRF的系统)有显著提升。
  • 当将字符级嵌入与基于词形的形态嵌入(ME(WOR))结合时性能最佳,表明存在互补的信息增益。
  • 基于字符级分析的形态嵌入(ME(CHAR))在形态标注错误的情况下表现出更强的鲁棒性,优于基于词根(ME(WR))和基于词形的(ME(WR_ADB))配置。
  • 尽管字符嵌入带来了性能提升,但字符嵌入与形态嵌入的组合仍达到最高性能,表明二者捕获的信息并非冗余。
  • McNemar检验显示,性能最高的两个设置(93.59%与93.37%)之间无统计学上的显著差异,表明当字符嵌入已存在时,形态嵌入带来的增益是边际的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。