Skip to main content
QUICK REVIEW

[论文解读] Related terms search based on WordNet / Wiktionary and its application in Ontology Matching

Andrew Krizhanovsky, Feiyu Lin|ArXiv.org|Jul 13, 2009
Natural Language Processing Techniques参考文献 22被引用 14
一句话总结

本文提出了一种使用俄语维基词典作为同义词典资源的本体匹配语义相似度方法,与基于WordNet的方法进行比较。该研究引入了一个开源的维基词典解析器以提取相关术语,并计算语义距离,表明基于维基词典的度量方法能够有效衡量跨语言词语的相关性,其性能在353个英文词对的基准测试中与基于WordNet的方法相当。

ABSTRACT

A set of ontology matching algorithms (for finding correspondences between concepts) is based on a thesaurus that provides the source data for the semantic distance calculations. In this wiki era, new resources may spring up and improve this kind of semantic search. In the paper a solution of this task based on Russian Wiktionary is compared to WordNet based algorithms. Metrics are estimated using the test collection, containing 353 English word pairs with a relatedness score assigned by human evaluators. The experiment shows that the proposed method is capable in principle of calculating a semantic distance between pair of words in any language presented in Russian Wiktionary. The calculation of Wiktionary based metric had required the development of the open-source Wiktionary parser software.

研究动机与目标

  • 开发一种使用俄语维基词典作为同义词典资源来计算词语之间语义相似度的方法。
  • 评估基于维基词典的语义距离计算性能与既有的基于WordNet的方法相比的表现。
  • 实现对俄语维基词典所支持的任何语言的词对进行语义相似度计算。
  • 开发并发布一个开源的维基词典解析器,用于提取相关术语和语义关系。
  • 评估使用维基词典作为可扩展的、多语言的WordNet替代方案在本体匹配中的可行性与有效性。

提出的方法

  • 作者开发了一个定制的开源维基词典解析器,用于从俄语维基词典条目中提取词汇和语义关系。
  • 解析器从维基词典页面中提取相关术语、同义词和上下位词,将其建模为一个语义网络。
  • 使用基于路径或图的度量方法在提取的网络上计算词对之间的语义距离。
  • 通过利用俄语维基词典的多语言内容和跨语言链接,该方法支持多语言处理。
  • 使用包含353个英文词对的人工分配相关性分数的基准测试集对方法进行评估。
  • 使用标准评估指标将结果与基于WordNet的度量方法进行比较,尽管摘要中未报告具体数值。

实验结果

研究问题

  • RQ1能否有效利用俄语维基词典作为同义词典来计算词对之间的语义相似度?
  • RQ2基于维基词典的语义距离计算性能与基于WordNet的方法相比如何?
  • RQ3维基词典在本体匹配中能在多大程度上支持多语言语义相似度计算?
  • RQ4将维基词典用作可扩展的、开源的WordNet替代方案在语义相似度任务中的可行性如何?
  • RQ5开源的维基词典解析器能否可靠地提取并结构化语义关系以供下游NLP应用使用?

主要发现

  • 基于维基词典的语义距离度量能够为俄语维基词典中包含的任何语言的词对计算相关性得分。
  • 该方法表明维基词典可作为本体匹配中语义相似度计算的可行替代方案,与WordNet相当。
  • 开发专用的维基词典解析器对于从维基的非结构化格式中提取结构化语义数据至关重要。
  • 所提出的方法在353个词对的基准测试集中与基于WordNet的方法相比表现出具有竞争力的性能。
  • 结果证实了维基词典作为多语言、社区驱动的语义相似度任务资源的潜力。
  • 开源解析器软件已成功实现并发布,支持可复现性及进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。