[论文解读] Exploring Large Language Models for Ontology Alignment
本文研究了使用大型语言模型(LLMs)如 Flan-T5-XXL 和 GPT-3.5-turbo 进行零样本本体对齐的可行性,提出了一种基于提示的框架,利用概念标签和结构上下文(如父/子关系)来识别语义等价性。结果表明,Flan-T5-XXL 配合阈值处理在 NCIT-DOID 子集上取得了 0.721 的 F1 分数,优于 BERTMap 的 F1 分数,展示了在正确提示下 LLM 在本体匹配中的潜力。
This work investigates the applicability of recent generative Large Language Models (LLMs), such as the GPT series and Flan-T5, to ontology alignment for identifying concept equivalence mappings across ontologies. To test the zero-shot performance of Flan-T5-XXL and GPT-3.5-turbo, we leverage challenging subsets from two equivalence matching datasets of the OAEI Bio-ML track, taking into account concept labels and structural contexts. Preliminary findings suggest that LLMs have the potential to outperform existing ontology alignment systems like BERTMap, given careful framework and prompt design.
研究动机与目标
- 评估在不进行微调的情况下,使用大型语言模型(LLMs)进行零样本本体对齐的可行性。
- 研究概念标签和结构上下文(如父/子关系)对基于 LLM 的匹配性能的影响。
- 将基于 LLM 的系统与 BERTMap 和 BERTMapLt 等成熟基线方法在具有挑战性、非平凡的本体匹配子集上进行比较。
- 识别从 LLM 中提取可靠“是/否”预测的关键挑战,并优化提示设计以实现语义等价性检测。
- 探索通过精心设计的框架和提示工程,LLM 在本体匹配中超越现有方法的潜力。
提出的方法
- 设计了一种零样本提示框架,其中 LLM 基于概念名称和层次结构上下文,判断源本体和目标本体中的两个概念是否等价。
- 提示包含结构化输入:源概念和目标概念的概念标签、父概念和子概念。
- 模型输出被解释为二分类任务:'是'表示等价,'否'表示非等价,'是'标记的概率用作置信度分数。
- 应用阈值处理以过滤低置信度的'是'预测,从而在牺牲召回率的代价下提升精确率。
- 将父概念和子概念名称作为额外上下文,以增强模型对结构关系的理解。
- 使用标准本体匹配指标(精确率、召回率、F1 分数、Hits@1、MRR 和 RR)在 OAEI 生物-机器学习赛道的两个具有挑战性的子集上评估系统。
实验结果
研究问题
- RQ1Flan-T5-XXL 和 GPT-3.5-turbo 等 LLM 是否能在不进行微调的情况下,在零样本本体对齐中实现具有竞争力的性能?
- RQ2在本体匹配中引入结构上下文(如父概念和子概念)是否能提升基于 LLM 的匹配准确性?
- RQ3对 LLM 输出分数进行阈值处理是否能改善映射预测中的精确率-召回率权衡?
- RQ4在排除字符串匹配的非平凡数据集上,基于 LLM 的系统与 SOTA 基线方法(如 BERTMap 和 BERTMapLt)相比表现如何?
- RQ5从 LLM 中提取可靠二分类预测以用于本体对齐任务的关键挑战是什么?
主要发现
- Flan-T5-XXL 配合阈值处理在 NCIT-DOID 子集上取得了 0.721 的 F1 分数,优于 BERTMap 的 0.628。
- 在 SNOMED-FMA(Body)子集上,Flan-T5-XXL 配合阈值处理取得了 0.346 的 F1 分数,优于 BERTMapLt 的 0.395,接近 BERTMap 的 0.552。
- 在 NCIT-DOID 子集上,阈值处理将精确率从 0.643 提升至 0.861,但召回率从 0.720 降低至 0.620。
- 引入父/子概念上下文并未提升性能,甚至在某些情况下降低了 F1 分数,表明当前的上下文整合策略尚不理想。
- GPT-3.5-turbo 表现较差(F1 分数 0.132),且无法稳定输出二分类响应,可能由于其倾向于生成冗长解释且缺乏概率提取能力。
- BERTMapLt 在排除字符串匹配的子集上表现欠佳,符合预期,因为其依赖编辑相似度,而此类配对被排除后该方法失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。