Skip to main content
QUICK REVIEW

[论文解读] Semi-supervised Word Sense Disambiguation with Neural Models

Dayu Yuan, Julian Richardson|arXiv (Cornell University)|Mar 22, 2016
Natural Language Processing Techniques参考文献 37被引用 83
一句话总结

本文提出了一种半监督词义消歧(WSD)框架,利用长短期记忆(LSTM)网络捕捉序列和句法上下文,其性能优于传统的基于Word2Vec的方法。通过将LSTM语言模型与基于已标注和未标注句子图的标签传播相结合,该方法在SOTA性能上表现优异,尤其在动词上,相较于强基线方法在SemEval全词任务上实现了10%的性能提升。

ABSTRACT

Determining the intended sense of words in text - word sense disambiguation (WSD) - is a long standing problem in natural language processing. Recently, researchers have shown promising results using word vectors extracted from a neural network language model as features in WSD algorithms. However, a simple average or concatenation of word vectors for each word in a text loses the sequential and syntactic information of the text. In this paper, we study WSD with a sequence learning neural net, LSTM, to better capture the sequential and syntactic patterns of the text. To alleviate the lack of training data in all-words WSD, we employ the same LSTM in a semi-supervised label propagation classifier. We demonstrate state-of-the-art results, especially on verbs.

研究动机与目标

  • 为解决大规模词汇量下全词词义消歧(WSD)中训练数据标注有限的挑战。
  • 通过使用循环神经网络(LSTM)而非静态词嵌入来捕捉序列和句法上下文,以提升WSD性能。
  • 通过半监督标签传播利用大规模未标注文本数据,以提高词义分类的准确性。
  • 证明将LSTM语言模型与基于图的标签传播相结合,相比监督基线方法可获得更优结果。

提出的方法

  • 在1000亿词的新闻语料上训练1000维的Word2Vec模型,以生成初始词嵌入。
  • 使用LSTM网络编码上下文序列,比词袋模型更有效地捕捉序列和句法模式。
  • 构建一个图结构,其中节点代表句子,边基于LSTM编码的句子表示之间的余弦相似度确定。
  • 应用标签传播(LP)算法,通过图结构将少量已标注句子示例的词义标签传播到大量未标注句子上。
  • 使用LP预测的标签作为训练数据,以优化WSD分类器,改善决策边界和词义分布估计。
  • 在SemEval基准上使用F1分数评估性能,与Word2Vec基线和最常见词义模型进行比较。

实验结果

研究问题

  • RQ1与静态词嵌入(如Word2Vec)相比,基于LSTM的语言模型是否能提升WSD性能,尤其是在动词上?
  • RQ2在标注数据稀缺的情况下,对已标注和未标注句子构成的图进行半监督标签传播是否能提升WSD准确率?
  • RQ3语言模型的质量(Word2Vec vs. LSTM)如何影响WSD中标签传播的性能?
  • RQ4图的密度和种子数据构成对WSD中标签传播有效性的影响力如何?
  • RQ5所提出的方法是否能泛化到其他词性,并在不同词类上实现一致的性能提升?

主要发现

  • 在SemEval全词任务中,基于LSTM的WSD模型相较于Word2Vec基线在F1分数上提升了10%,尤其在动词上表现突出。
  • 使用LSTM模型进行标签传播后,F1分数在SemCor上提升了6.3个百分点,在MASC上提升了7.3个百分点,相较Word2Vec基线。
  • 当训练数据同时包含NOAD和SemCor或MASC时性能最佳,表明多样化的种子数据可增强标签传播效果。
  • 图的密度具有明显影响:在亲和度阈值的85%至98%分位数之间,F1分数保持稳定,但在80%分位数时显著下降。
  • 当使用NOAD和SemCor/MASC作为训练数据时,模型在SemCor上的F1分数达到0.872,在MASC上达到0.873,表现出强大的泛化能力。
  • 该方法对每词素的未标注句子数量变化具有鲁棒性,增加未标注数据量并未带来显著性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。