Skip to main content
QUICK REVIEW

[论文解读] To lemmatize or not to lemmatize: how word normalisation affects ELMo performance in word sense disambiguation

Andrey Kutuzov, Elizaveta Kuzmenko|arXiv (Cornell University)|Sep 6, 2019
Topic Modeling参考文献 11被引用 10
一句话总结

本文研究了词形还原是否能提升 ELMo 在英语和俄语词义消歧(WSD)任务中的表现。模型在原始词符和词形还原文本上分别进行训练,结果表明,对于词形丰富的俄语,词形还原带来了微小但稳定的 WSD 性能提升;而对于英语,收益可忽略不计,凸显了语言形态特性对深度学习模型仍具有影响。

ABSTRACT

We critically evaluate the widespread assumption that deep learning NLP models do not require lemmatized input. To test this, we trained versions of contextualised word embedding ELMo models on raw tokenized corpora and on the corpora with word tokens replaced by their lemmas. Then, these models were evaluated on the word sense disambiguation task. This was done for the English and Russian languages. The experiments showed that while lemmatization is indeed not necessary for English, the situation is different for Russian. It seems that for rich-morphology languages, using lemmatized training and testing data yields small but consistent improvements: at least for word sense disambiguation. This means that the decisions about text pre-processing before training ELMo should consider the linguistic nature of the language in question.

研究动机与目标

  • 挑战一种假设,即像 ELMo 这类深度学习 NLP 模型无需进行词形还原或其他归一化处理。
  • 评估在词形还原语料上训练 ELMo 是否能相比原始词符文本提升词义消歧(WSD)性能。
  • 探究词形还原的影响是否因语言的形态复杂度不同而异,特别是英语(形态简单)与俄语(形态丰富)之间的差异。
  • 确定词形还原是否影响 WSD 分数的一致性与稳定性,尤其是对具有语义上明显或相近意义的歧义词。

提出的方法

  • 从头开始在相同训练语料的原始版本和词形还原版本上训练 ELMo 模型:英语维基百科和俄语维基百科 + RNC。
  • 使用 UDPipe 进行分词与词形还原,英语准确率约 96%,俄语约 97%。
  • 在两个 WSD 基准上评估模型:英语的 Senseval-3 和俄语的 RUSSE’18,重点关注名词目标词。
  • 从 ELMo 的顶层提取上下文相关的词表示,并用于训练 WSD 分类器。
  • 在两种语言的多个目标词上,比较基于原始词符与基于词形还原形式训练的模型之间的 F1 分数差异。
  • 分析词形还原对具有或不具有屈折形式的词的影响,特别关注因失去屈折信息而导致性能下降的案例。

实验结果

研究问题

  • RQ1对英语和俄语的训练和测试数据进行词形还原,是否能提升 ELMo 在词义消歧中的表现?
  • RQ2词形还原的收益是否依赖于语言的形态丰富程度?
  • RQ3为何某些词在词形还原后性能显著下降,特别是在俄语中?
  • RQ4屈折形式的存在或缺失如何影响基于词形的 ELMo 模型与基于词符的 ELMo 模型之间的相对性能?
  • RQ5词形还原在多大程度上提升了不同词义之间的 WSD 稳定性与一致性?

主要发现

  • 对于英语,词形还原对 WSD 性能的提升可忽略不计,F1 差异低于 0.01,且无统计显著性。
  • 对于俄语,词形还原带来了微小但一致的 WSD 性能提升,多个目标词均观察到 F1 提升,尤其在语义上明显不同的词义上。
  • 如 акция(‘stock/share’)和 крона(‘crown/tree’)等词在基于词形的模型中 F1 显著提升,表明模型能更好地区分上下文。
  • 单词 домино(‘domino game/costume’)在基于词形的模型中性能略有下降,可能因其缺乏屈折形式,导致上下文形态线索丢失。
  • 对于 байка 和 гвоздика 这类不同词义对应不同词形的词,基于词形的模型表现出显著的 F1 提升,证实词形还原质量直接影响结果。
  • 结果表明,词形还原通过帮助模型更好地处理多种词形,使形态丰富的语言受益;但对于无屈折形式或借用词,若依赖屈折上下文信息,反而可能损害性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。