Skip to main content
QUICK REVIEW

[论文解读] Evaluating Ontology Matching Systems on Large, Multilingual and Real-world Test Cases

Christian Meilicke, Ondřej Šváb-Zamazal|arXiv (Cornell University)|Aug 15, 2012
Semantic Web and Ontologies参考文献 25被引用 3
一句话总结

本文在 OAEI 2011.5 活动中,使用标准化基准和自动化评估基础设施,对 18 种本体匹配系统在大规模、多语言和真实世界测试用例上进行了评估。主要贡献包括识别出可扩展性挑战、多语言支持限制以及对齐的一致性问题,其中 LogMap 在对齐一致性方面表现最佳,而 GOMMA(使用背景知识)在大多数任务中 F-measure 最高。

ABSTRACT

In the field of ontology matching, the most systematic evaluation of matching systems is established by the Ontology Alignment Evaluation Initiative (OAEI), which is an annual campaign for evaluating ontology matching systems organized by different groups of researchers. In this paper, we report on the results of an intermediary OAEI campaign called OAEI 2011.5. The evaluations of this campaign are divided in five tracks. Three of these tracks are new or have been improved compared to previous OAEI campaigns. Overall, we evaluated 18 matching systems. We discuss lessons learned, in terms of scalability, multilingual issues and the ability do deal with real world cases from different domains.

研究动机与目标

  • 评估本体匹配系统在大规模、多语言和真实世界数据集上的性能,以反映其在真实世界中的适用性。
  • 评估系统在本体规模和复杂性增加时的可扩展性。
  • 研究多语言支持对匹配质量的影响,特别是在语义网应用中的表现。
  • 分析对齐一致性及其对下游应用(如查询处理)的影响。
  • 通过 SEALS 基础设施建立可复现、自动化的评估流程,以实现一致的基准测试。

提出的方法

  • 在 OAEI 2011.5 中开展了一次中间阶段的活动,使用来自生物医学、会议和多语言本体等多样化领域的标准化数据集。
  • 通过 SEALS 项目基础设施提供受控执行环境,确保评估的可复现性和自动化。
  • 使用精确率、召回率、F1 值、运行时间以及通过 HermiT 推理在合并本体与对齐结果上的对齐一致性来评估系统。
  • 使用标准对齐作为参考,包括优化后的和原始的基于 UMLS 的对齐,以衡量符合度。
  • 应用多个测试用例:基准测试(可扩展性)、MultiFarm(多语言)、Large BioMed(真实世界复杂性)等。
  • 在不同配置(如 GOMMA 是否使用背景知识)和硬件环境(16 个 CPU,10GB 内存)下测量性能。

实验结果

研究问题

  • RQ1本体匹配系统在大规模、真实世界本体上的精确率、召回率和 F1 值表现如何?
  • RQ2系统在多语言标签处理方面的表现如何?不同语言类型对匹配质量有何影响?
  • RQ3本体规模和结构复杂性(类和属性数量)对系统可扩展性和运行时间有何影响?
  • RQ4对齐一致性度量与精确率和召回率的相关性如何?哪些系统产生了适合推理的一致性对齐?
  • RQ5计算资源(如多核 CPU)是否能显著提升性能?哪些系统能有效利用这些资源?

主要发现

  • GOMMA 搭配背景知识(GOMMA_bk)在任务 1 中取得了最高的 F1 值(0.921),并在所有任务中保持强劲表现,F1 值在最大任务(任务 3)中下降至 0.818。
  • LogMap 生成了最一致的对齐结果,在推理中未检测到任何不满足的类,而 GOMMA_nobk 虽然精确率高,但因 100% 的不满足类而产生不一致的对齐。
  • 仅 LogMap、CODI 和 YAM++ 在所有赛道中持续生成一致的对齐结果,凸显了对齐质量评估中的关键差距。
  • 运行时间随本体规模显著增加,GOMMA_bk 在最大任务(任务 3)中耗时超过 18 分钟,而 CSA 在所有任务中均保持稳定表现。
  • 多语言支持仍然薄弱:在 MultiFarm 数据集中,仅有 3 个系统有效处理了多语言标签,表明其在多语言知识集成方面存在重大限制。
  • 尽管有所改进,但没有任何系统在基准测试和 Large BioMed 赛道中超越基线系统 LogMapLt 的 F1 值,表明在不损失精确率的前提下检测非平凡对应关系仍具高度挑战性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。