[论文解读] Towards Ontology-Enhanced Representation Learning for Large Language Models
本论文提出了一种新颖方法,通过利用GPT-3.5-turbo生成合成定义并结合对比微调,将生物医学本体(特别是MONDO)的知识注入基于嵌入的大型语言模型(LLMs),以提升其性能。该方法在不损害模型在域外任务上的能力的前提下,提升了域内句子相似度性能,并在多种LLM架构上表现出一致的性能增益,尤其对采用基础预训练方法的模型效果更显著。
Taking advantage of the widespread use of ontologies to organise and harmonize knowledge across several distinct domains, this paper proposes a novel approach to improve an embedding-Large Language Model (embedding-LLM) of interest by infusing the knowledge formalized by a reference ontology: ontological knowledge infusion aims at boosting the ability of the considered LLM to effectively model the knowledge domain described by the infused ontology. The linguistic information (i.e. concept synonyms and descriptions) and structural information (i.e. is-a relations) formalized by the ontology are utilized to compile a comprehensive set of concept definitions, with the assistance of a powerful generative LLM (i.e. GPT-3.5-turbo). These concept definitions are then employed to fine-tune the target embedding-LLM using a contrastive learning framework. To demonstrate and evaluate the proposed approach, we utilize the biomedical disease ontology MONDO. The results show that embedding-LLMs enhanced by ontological disease knowledge exhibit an improved capability to effectively evaluate the similarity of in-domain sentences from biomedical documents mentioning diseases, without compromising their out-of-domain performance.
研究动机与目标
- 通过整合来自外部本体的结构化知识与语言知识,提升基于嵌入的LLM的表征学习能力。
- 解决领域特定LLM在捕捉生物医学等专业领域中精确语义关系方面的局限性。
- 开发一种自动化、可扩展的知识注入方法,同时利用本体结构与生成式LLM。
- 评估知识增强型LLM在域内与域外句子相似度任务上的有效性。
- 确保该方法在提升性能的同时,不损害模型的泛化能力。
提出的方法
- 利用GPT-3.5-turbo,基于本体中的语言信息(同义词、描述)与结构信息(is-a关系),为所有本体概念生成合成的、全面的概念定义。
- 根据本体关系与语义相似度,通过配对语义上相似与不相似的定义,构建对比学习的训练样本。
- 采用对比学习目标对目标嵌入LLM进行微调,使正样本对的嵌入相似度最大化,负样本对的嵌入相似度最小化。
- 采用双编码器框架,在微调过程中由LLM同时编码正样本对与负样本对的定义。
- 将知识注入流程应用于MONDO——一个生物医学疾病本体,以评估其对疾病相关句子相似度的影响。
- 通过在GitHub上开源框架、提示词、超参数与评估流程,确保方法的可复现性。

实验结果
研究问题
- RQ1将来自结构化本体(如MONDO)的知识注入,能否提升基于嵌入的LLM在生物医学领域句子相似度任务上的性能?
- RQ2在知识注入后,所提出的方法是否能维持或提升LLM在域外任务上的泛化能力?
- RQ3不同LLM架构在采用不同预训练策略时,性能增益如何变化?
- RQ4与仅基于名词短语或同义词的方法相比,基于本体结构生成的完整句子定义在多大程度上表现更优?
- RQ5生成式LLM能否有效合成高质量、多样化的定义,从而增强对比微调的效果?
主要发现
- 经MONDO本体知识增强的嵌入LLM在域内句子相似度任务上表现更优,尤其对采用基础预训练方法的模型(如PubMedBERT)效果显著。
- 该方法维持或轻微提升了域外性能,表明未对模型的泛化能力造成损害。
- GTEbase与GIST等更先进的模型在大多数评估场景中表现出较小但一致的性能提升。
- SapBERT——一种先进的生物医学LLM,在知识注入后进一步提升了性能,证实该方法在强基线模型上同样有效。
- 该方法展现出良好的可扩展性与可复现性,完整实现与评估代码已公开发布于GitHub。
- 基于本体结构生成的完整句子定义,相比基于同义词的方法,能生成更鲁棒、语义更丰富的表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。