Skip to main content
QUICK REVIEW

[论文解读] A Semantic Relatedness Measure Based on Combined Encyclopedic, Ontological and Collocational Knowledge

Yannis Haralambous, Vitaly Klyuev|arXiv (Cornell University)|Jul 24, 2011
Natural Language Processing Techniques参考文献 29被引用 8
一句话总结

本文提出了一种新颖的语义相关性度量方法,整合了基于维基百科的显式语义分析(ESA)、基于WordNet的路径相似性以及混合搭配指数,以提升语义相关性任务的性能。联合方法在WS-353基准测试中取得了0.79的Spearman等级相关系数,超越了先前的最先进结果;当结合多项式SVM分类器后,性能进一步提升至0.87,证明了多源知识融合在语义相似性建模中的有效性。

ABSTRACT

We describe a new semantic relatedness measure combining the Wikipedia-based Explicit Semantic Analysis measure, the WordNet path measure and the mixed collocation index. Our measure achieves the currently highest results on the WS-353 test: a Spearman rho coefficient of 0.79 (vs. 0.75 in (Gabrilovich and Markovitch, 2007)) when applying the measure directly, and a value of 0.87 (vs. 0.78 in (Agirre et al., 2009)) when using the prediction of a polynomial SVM classifier trained on our measure. In the appendix we discuss the adaptation of ESA to 2011 Wikipedia data, as well as various unsuccessful attempts to enhance ESA by filtering at word, sentence, and section level.

研究动机与目标

  • 解决现有语义相关性度量方法(尤其是ESA)在捕捉分布共现之外的多样化语义关系方面的局限性。
  • 通过整合多种知识源,提升在WS-353基准测试上的性能,该基准测试是评估语义相关性的事实标准。
  • 通过引入本体论和搭配知识,克服ESA在特定词对上的不足,尤其针对同义关系、上下位关系和固定短语。
  • 证明结合多种知识源——百科全书式(ESA)、本体论式(WordNet)和搭配式——相比单一方法能取得更优性能。

提出的方法

  • 使用tf-idf加权词向量对2011年维基百科数据应用显式语义分析(ESA),将概念表示为主题向量,并通过余弦相似度计算词向量之间的相似度。
  • 将基于WordNet的路径相似性(WNP)作为本体论相关性的度量,使用每对词所有可能同义词集对中的最大相似度。
  • 引入混合搭配指数以捕捉在分布统计中未充分体现的固定短语和词汇搭配。
  • 通过加权平均或集成学习方法,将ESA、WNP和搭配指数三个组件整合为统一的语义相关性得分。
  • 在原始组合得分上训练多项式SVM分类器,以进一步优化排序性能,提高与人类判断的相关性。
  • 通过设定最低术语数和链接阈值(200个术语,14个链接)过滤低质量页面,优化2011年维基百科上ESA的性能,使其恢复至2005年的水平。

实验结果

研究问题

  • RQ1将百科全书式、本体论式和搭配式知识相结合,是否能显著提升标准基准测试上的语义相关性性能?
  • RQ2为何现有方法(如ESA)在某些WS-353词对上表现不佳,具体缺失了哪些语义关系?
  • RQ3基于WordNet的路径度量和搭配指数在多大程度上能补充分布语义学,以捕捉同义关系、上下位关系和固定短语?
  • RQ4通过训练SVM分类器进行后处理,是否能进一步提升组合语义相似度度量的排序质量?
  • RQ5维基百科的演变(如从2005年到2011年)如何影响ESA的性能?是否可通过概念过滤加以缓解?

主要发现

  • 所提出的组合语义相关性度量方法在直接应用于WS-353测试集时,取得了0.79的Spearman等级相关系数,优于先前最先进水平(0.75)。
  • 当与在该度量输出上训练的多项式SVM分类器结合后,性能进一步提升至0.87,超越了此前最佳结果(0.78)。
  • ESA在2011年维基百科数据上的性能最初因概念数量增加和术语密度降低而下降至0.7047,但通过过滤术语少于200个且入/出链接少于14个的页面,性能恢复至0.7394。
  • 在词级进行词形还原和词性过滤会降低性能(分别降至0.7194和0.7178),表明对此任务而言,Porter词干化仍优于词形还原。
  • 将句子级权重提升三倍以及进行章节级过滤(如移除“历史”章节)均导致性能下降(分别降至0.7293和0.6608),表明此类过滤策略对本任务无益。
  • 研究证实,术语密度和概念质量对ESA性能至关重要,且通过战略性地修剪低质量维基百科页面可恢复性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。