Skip to main content
QUICK REVIEW

[论文解读] Similarity-Based Methods For Word Sense Disambiguation

Ido Dagan, Lillian Lee|ArXiv.org|Aug 18, 1997
Natural Language Processing Techniques参考文献 13被引用 15
一句话总结

本文提出基于相似性的概率语言模型,以解决词义消歧中的数据稀疏性问题,利用词对相似性来估计未见共现的概率。结果表明,这些模型,特别是基于对平均分布的总差异的模型,相较于传统的回退法和最大似然估计法,在伪词义消歧任务中性能提升最高达40%,且单频词在性能中起关键作用。

ABSTRACT

We compare four similarity-based estimation methods against back-off and maximum-likelihood estimation methods on a pseudo-word sense disambiguation task in which we controlled for both unigram and bigram frequency. The similarity-based methods perform up to 40% better on this particular task. We also conclude that events that occur only once in the training set have major impact on similarity-based estimates.

研究动机与目标

  • 通过改进未见词对的概率估计,解决自然语言处理中的数据稀疏性问题。
  • 评估基于相似性的估计方法作为基于类别或回退模型的替代方案。
  • 研究低频事件(尤其是单频词)对基于相似性的估计的影响。
  • 将多种基于相似性的模型与经典估计技术的性能进行比较。
  • 评估在基于相似性的语言建模中,是否可以安全地舍弃单频词,如回退方法中所声称的那样。

提出的方法

  • 该方法利用词相似性,结合相似词的证据,以估计未见词对的概率。
  • 采用加权组合的观测共现频率,其中权重由词之间的相似性函数决定。
  • 关键的相似性度量 A(w1, w1') 计算的是某词的经验分布相对于所有词平均分布的总差异。
  • 该模型使用参数 β 控制相似词的影响,该参数在每个训练集上进行优化。
  • 该方法避免预定义的词类,而是依赖于局部相似性邻域。
  • 它比较了四种基于相似性的方法:L1 范数、混淆概率、对平均分布的总差异(A),以及随机加权基线(RAND)。

实验结果

研究问题

  • RQ1与经典的回退法和MLE方法相比,基于相似性的估计方法是否能在未见词对概率估计上显著提升性能?
  • RQ2不同相似性度量(如L1范数、混淆概率、总差异)在建模未见共现方面的能力如何比较?
  • RQ3移除单频事件(频率为1的出现)对基于相似性的模型性能有何影响?
  • RQ4对平均分布的总差异是否相较于其他基于相似性的方法提供了统计上显著的性能提升?
  • RQ5在基于相似性的语言建模中,是否可以像回退方案中那样安全地舍弃单频词?

主要发现

  • 基于对平均分布总差异的相似性方法(A)表现最佳,相较于混淆概率方法平均提升0.0082,p < 0.085,具有显著性。
  • 所有基于相似性的方法相较于回退法和MLE方法,错误率降低最高达40%,两者准确率均约为51%。
  • 当忽略单频词时,基于对平均分布总差异的方法(A)相较于混淆概率方法平均提升0.024,配对t检验在0.01水平上显著。
  • 在训练数据中包含单频词对基于相似性的模型至关重要;若省略单频词,性能显著下降,这与回退模型中认为单频词可安全忽略的假设相矛盾。
  • 随机加权基线(RAND)表现较差,表明相似性感知的加权至关重要,而不仅仅是简单地结合其他词的信息。
  • 最优 β 参数在L1范数方法中为4.0至4.5之间,在总差异方法中为10至13之间,当包含单频词时使用更高的值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。