Skip to main content
QUICK REVIEW

[论文解读] Mesure de la similarité entre termes et labels de concepts ontologiques

Van Tien Nguyen, Christian Sallaberry|arXiv (Cornell University)|Jul 24, 2013
Data Management and Algorithms参考文献 16被引用 4
一句话总结

本文提出了一种混合字符串相似度度量方法 Liuppa(i,j),该方法在标记和字符序列两个层次上结合两种基于字符的字符串度量方法(Jaro-Winkler),以提升本体标签与术语之间的相似度测量效果。该方法在Cohen数据集上表现优异,排名第三,尤其在词序具有重要意义时表现突出,并可通过匹配如 'chemin de fer touristique' 这类术语与本体标签 'voie ferrée touristique',实现地理信息检索中准确的地理空间实体分类。

ABSTRACT

We propose in this paper a method for measuring the similarity between ontological concepts and terms. Our metric can take into account not only the common words of two strings to compare but also other features such as the position of the words in these strings, or the number of deletion, insertion or replacement of words required for the construction of one of the two strings from each other. The proposed method was then used to determine the ontological concepts which are equivalent to the terms that qualify toponymes. It aims to find the topographical type of the toponyme.

研究动机与目标

  • 开发一种稳健的方法,用于测量本体标签与自然语言术语之间的相似度,特别是在地理信息检索场景中。
  • 解决在多词标签中词序显著影响语义时的术语匹配挑战。
  • 将混合相似度度量方法集成到基于本体的地理空间实体分类流水线中,用于命名空间实体。
  • 利用代表性训练样本实现相似度度量的自动参数调优。
  • 通过增强初始的基于标签的比较阶段(在结构对齐之前),支持本体匹配工作流。

提出的方法

  • 该方法采用元度量框架 Liuppa(i,j),在两个层次上结合两种基础字符串度量方法(i 和 j):标记层次和字符序列层次。
  • 通过将第一种度量方法(例如 Jaro-Winkler)应用于单个标记,将第二种度量方法(例如 Jaro-Winkler)应用于完整字符串序列,然后合并结果来计算相似度。
  • 该方法考虑了词序、共同标记以及字符串之间的编辑操作(插入、删除、替换)。
  • 通过使用代表性样本进行参数调优阶段,选择最优的度量组合与阈值(ε = 0.84)以实现最佳性能。
  • 最终度量方法被应用于将从旅行叙述中提取的术语与地理空间本体标签匹配,以实现实体分类。
  • 该方法在两个数据集上进行了评估:一个自定义的地理空间术语-标签数据集和用于记录链接的 Cohen 数据集。

实验结果

研究问题

  • RQ1当词序在语义上具有重要意义时,如何改进多词术语与本体标签之间的字符串相似度?
  • RQ2在不同抽象层次(标记 vs. 字符序列)上,何种字符串度量组合能实现匹配术语与本体标签的最高准确率?
  • RQ3能否使用代表性训练样本自动参数化混合相似度度量,以实现在不同数据集上的稳健泛化?
  • RQ4与现有字符串度量方法相比,该方法在标准基准数据集上的性能表现如何?
  • RQ5该相似度度量在多大程度上能提升自然语言文档中地理空间实体分类的准确性?

主要发现

  • 在自定义地理空间术语-标签数据集上,Liuppa(JaroWinkler, JaroWinkler) 度量方法在14种评估度量中表现最佳,阈值 ε = 0.84。
  • 在 Cohen 数据集的记录链接任务中,该方法在15种度量中排名第三,优于许多标准方法,尤其在词序具有关键影响的情况下表现更优。
  • 该混合方法显著提升了如 'chemin de fer touristique' 与 'voie ferrée touristique' 这类术语的相似度测量效果,实现了正确的地理空间实体分类。
  • 该方法表现出强大的适应性,因为最优参数集(度量对与阈值)可从代表性样本中自动确定。
  • 该方法在真实地理信息检索场景中表现有效,成功将旅行叙述中的术语链接到适当的本体概念,如 'voie de communication'。
  • 元度量框架 Liuppa(i,j) 具有可推广性,适用于其他需要基于本体的术语匹配的领域,包括数据库记录链接。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。