Skip to main content
QUICK REVIEW

[论文解读] Incorporating Word Sense Disambiguation in Neural Language Models

Jan Philip Wahle, Terry Ruas|arXiv (Cornell University)|Jun 15, 2021
Natural Language Processing Techniques参考文献 27被引用 4
一句话总结

该论文提出两种监督式预训练方法——LMGC 和 LMGC-M——通过将 WordNet 词义定义整合到神经语言模型中,以在不显著增加参数量的情况下提升词义消歧(WSD)性能。通过在掩码语言建模和词义分类任务上联合训练,该方法在 SemEval 和 Senseval 基准测试中将 WSD 的 F1 分数提升了 0.5%,并在 GLUE 任务上平均提升了 1.1% 的性能,优于包括 GlossBERT 和 KBERT-W+W 在内的最先进模型。

ABSTRACT

We present two supervised (pre-)training methods to incorporate gloss definitions from lexical resources into neural language models (LMs). The training improves our models' performance for Word Sense Disambiguation (WSD) but also benefits general language understanding tasks while adding almost no parameters. We evaluate our techniques with seven different neural LMs and find that XLNet is more suitable for WSD than BERT. Our best-performing methods exceeds state-of-the-art WSD techniques on the SemCor 3.0 dataset by 0.5% F1 and increase BERT's performance on the GLUE benchmark by 1.1% on average.

研究动机与目标

  • 通过在预训练阶段整合 WordNet 词义定义中的词汇知识,提升神经语言模型在词义消歧(WSD)任务中的表现。
  • 在保持或提升模型在下游 NLP 任务(如文本相似度和句子分类)性能的同时,超越 WSD 任务本身。
  • 开发一种通用且参数高效的通用方法,适用于任何基于 Transformer 的语言模型,避免昂贵的微调或架构修改。
  • 证明 WSD 预训练可提升通用语言理解能力,表现为在 GLUE 等基准测试中性能的提升。
  • 提供公开可访问的实现代码,以支持知识增强型语言建模的可复现性与进一步研究。

提出的方法

  • 该方法——语言模型词义分类(LMGC)——将 WSD 任务视为文本分类任务,通过特殊分隔符将句子与 WordNet 中的候选词义定义拼接。
  • 模型通过两种监督信号进行微调:使用特殊标记突出显示歧义词,并在词义定义前添加多义词本身。
  • 在 [CLS] 标记的表示上应用线性分类头,以预测正确的词义定义,从而利用模型的上下文嵌入。
  • 增强方法 LMGC-M 在单次训练过程中联合优化掩码语言建模(MLM)与词义分类,通过联合优化提升表示学习效果。
  • 该方法被应用于多种预训练模型(如 BERT、RoBERTa、XLNet),且未对词嵌入或注意力机制进行任何修改。
  • 该方法避免使用参数密集型机制(如知识注意力或词片重分词),确保高效性与可扩展性。

实验结果

研究问题

  • RQ1在预训练阶段整合 WordNet 词义定义是否能提升神经语言模型在词义消歧任务中的性能?
  • RQ2在词义定义上进行 WSD 预训练是否能提升模型在 WSD 以外的下游 NLP 任务中的泛化能力?
  • RQ3与单独或顺序微调相比,MLM 与词义分类的联合训练(LMGC-M)在性能与效率方面表现如何?
  • RQ4轻量级、参数高效的模型是否能超越如 KBERT-W+W 这类使用复杂注意力机制且参数量高出四倍的模型?
  • RQ5WSD 预训练在 GLUE 和 SuperGLUE 等基准测试中能带来多大程度的性能提升?

主要发现

  • LMGC-M 在 SemEval 和 Senseval WSD 基准测试中,相较于表现最佳的基线模型(GlossBERT),F1 分数绝对提升了 0.5%。
  • 与 BERT BASE 基线相比,该方法在 GLUE 基准测试上的平均性能提升了 1.1%,表明其显著增强了通用语言理解能力。
  • LMGC-M 在性能上优于 KBERT-W+W,后者参数量约为其四倍,且训练时间多出 32%,同时保持相似的推理效率。
  • MLM 与词义分类的联合训练(LMGC-M)优于单独训练,表明语义与句法表示之间存在协同学习效应。
  • 基于 XLNet 的 LMGC-M 在所有测试模型中取得了最高的 WSD 性能,优于 BERT 和 RoBERTa,即使其参数量未增加。
  • 该方法泛化能力强:经 WSD 预训练的模型在多种 NLP 任务中均表现出一致的性能提升,包括文本相似度、句子分类和自然语言推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。