[论文解读] Using Large Language Models for OntoClean-based Ontology Refinement
本文提出使用大型语言模型(LLMs)如GPT-4,通过OntoClean方法论自动化本体精炼过程,具体表现为对类进行形而上学元属性(如刚性、同一性、统一性)的标注。通过在层次化本体表示上使用上下文学习提示,GPT-4在所有元属性上的准确率均超过95%,证明了将LLMs集成到本体工具中(通过专用插件)具有高度可行性。
This paper explores the integration of Large Language Models (LLMs) such as GPT-3.5 and GPT-4 into the ontology refinement process, specifically focusing on the OntoClean methodology. OntoClean, critical for assessing the metaphysical quality of ontologies, involves a two-step process of assigning meta-properties to classes and verifying a set of constraints. Manually conducting the first step proves difficult in practice, due to the need for philosophical expertise and lack of consensus among ontologists. By employing LLMs with two prompting strategies, the study demonstrates that high accuracy in the labelling process can be achieved. The findings suggest the potential for LLMs to enhance ontology refinement, proposing the development of plugin software for ontology tools to facilitate this integration.
研究动机与目标
- 为解决使用OntoClean方法论进行手动本体精炼所面临的挑战,该方法需要哲学专业知识且缺乏共识。
- 探究大型语言模型(LLMs)是否能够自动化分配OntoClean元属性到本体类。
- 评估不同提示策略(零样本提示与上下文学习)在LLMs执行此任务时的有效性。
- 比较GPT-3.5与GPT-4在使用平面与层次化本体表示时的性能表现。
- 提出将LLMs通过插件方式集成到本体工具(如Protégé)中,以实现可扩展的、人机协同的本体精炼工作流。
提出的方法
- 本研究采用两种提示策略:一种为零样本的‘裸’提示,另一种为包含OntoClean元属性定义的上下文学习提示。
- 本体输入以平面形式(作为实体列表)和层次化形式(从本体图的生成树导出的缩进树)表示。
- LLMs根据提供的定义和结构,为本体中的每个类标注所有相关的OntoClean元属性。
- 实验使用两个基准本体:上层本体(Upper Ontology)和迷你披萨本体(Mini Pizza Ontology)。
- 每种配置进行30次试验,结果汇总并比较不同模型、提示类型和表示风格的表现。
- 发现层次化表示对获得有意义结果至关重要,而平面表示因缺乏结构依赖性而被排除在最终分析之外。
实验结果
研究问题
- RQ1大型语言模型能否在极少提示的情况下准确地为本体类分配OntoClean元属性?
- RQ2上下文学习与零样本提示相比,是否能有效提升LLM在本体元属性标注任务中的准确率?
- RQ3LLM的选择(GPT-3.5与GPT-4)是否显著影响其在标注形而上学属性方面的性能?
- RQ4平面与层次化本体表示对LLM生成标签的可靠性有何影响?
- RQ5LLM在处理抽象本体概念(如统一性与同一性)方面的能力如何,这些概念需要哲学推理?
主要发现
- 使用上下文学习时,GPT-4在所有OntoClean元属性上的错误率约为4%,表明准确率超过95%。
- GPT-3.5表现欠佳,在零样本设置下,同一性与统一性的错误率高达60–70%,刚性与依赖性的错误率为35–40%。
- 上下文学习提升了GPT-3.5在刚性与依赖性上的表现,错误率降至25–30%,但对统一性无显著改善。
- 平面本体表示因缺乏结构上下文而产生不可用结果,被排除在最终分析之外。
- GPT-4在统一性上的表现未因上下文学习而提升,表明OntoClean中抽象且过时的定义可能阻碍模型的理解。
- 结果支持通过插件将LLMs集成到本体工具中的可行性,尤其适用于高准确率、人机协同的本体精炼工作流。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。