[论文解读] DALK: Dynamic Co-Augmentation of LLMs and KG to answer Alzheimer's Disease Questions with Scientific Literature
DALK 提出了一种动态协同增强框架,通过协同增强大型语言模型(LLMs)与知识图谱(KGs),提升阿尔茨海默病(AD)问答任务的性能。通过利用 LLM 从科学文献中构建一个动态演化的 AD 专用知识图谱,并应用从粗到细、具备自我意识的知识检索方法,DALK 在一个新的 ADQA 基准上实现了 72.6% 的 F1 分数,优于基线模型,验证了在特定领域生物医学问答中 LLM 与 KG 相互增强的价值。
Recent advancements in large language models (LLMs) have achieved promising performances across various applications. Nonetheless, the ongoing challenge of integrating long-tail knowledge continues to impede the seamless adoption of LLMs in specialized domains. In this work, we introduce DALK, a.k.a. Dynamic Co-Augmentation of LLMs and KG, to address this limitation and demonstrate its ability on studying Alzheimer's Disease (AD), a specialized sub-field in biomedicine and a global health priority. With a synergized framework of LLM and KG mutually enhancing each other, we first leverage LLM to construct an evolving AD-specific knowledge graph (KG) sourced from AD-related scientific literature, and then we utilize a coarse-to-fine sampling method with a novel self-aware knowledge retrieval approach to select appropriate knowledge from the KG to augment LLM inference capabilities. The experimental results, conducted on our constructed AD question answering (ADQA) benchmark, underscore the efficacy of DALK. Additionally, we perform a series of detailed analyses that can offer valuable insights and guidelines for the emerging topic of mutually enhancing KG and LLM. We will release the code and data at https://github.com/David-Li0406/DALK.
研究动机与目标
- 为解决 LLM 在捕捉阿尔茨海默病(AD)领域中长尾知识与特定领域知识方面的局限性,特别是由于科学文献中存在噪声或无关信息所致的问题。
- 通过采用轻量级、无需微调的协同增强框架,克服微调领域专用 LLM 所带来的效率与可扩展性问题。
- 通过构建专门的 AD 知识图谱并应用自我意识检索机制,提升 LLM 推理过程中检索知识的质量与相关性。
- 基于医学考试题与 LLM 自采样,构建一个新的大规模 AD 问答基准(ADQA),以实现对 AD 领域专用 LLM 系统的严格评估。
- 为复杂且不断演化的领域(如 AD)中的生物医学 LLM 应用,提供关于有效 KG 构建与知识检索策略的可操作洞察。
提出的方法
- 利用 LLM 从非结构化的 AD 相关科学文献中提取并结构化知识,采用成对与生成式知识构建方法,构建一个动态演化的 AD 专用知识图谱(AD-KG)。
- 采用从粗到细的采样策略,从 AD-KG 中逐步缩小候选知识子图范围,降低噪声并提升检索相关性。
- 提出一种新颖的自我意识知识检索方法,基于输入查询与知识三元组之间的语义对齐,动态选择最相关的 top-k 三元组,最大限度减少无关信息。
- 设计一种无需微调的框架,通过解耦知识图谱构建与推理增强,避免重新训练 LLM,从而实现与大规模及 API 接口式 LLM 的高效集成。
- 通过使用筛选后的关键词列表与基于 LLM 的自采样方法,从通用医学问答数据集中过滤出数百万个样本,构建 ADQA 基准,确保领域相关性与覆盖度。
- 在 LLM 推理中使用思维链提示(chain-of-thought prompting),并辅以检索到的 KG 三元组,提升 AD 专属问题的推理能力与答案准确率。

实验结果
研究问题
- RQ1与标准检索增强或领域微调的 LLM 相比,LLM 与 KG 的动态协同增强在提升阿尔茨海默病问答任务答案准确率方面的有效性如何?
- RQ2不同的知识图谱构建方法(成对法 vs. 生成法)对最终 AD-KG 的质量及其下游性能有何影响?
- RQ3在存在噪声或无关子图的情况下,自我意识知识检索机制相比基线检索策略,如何提升答案准确率?
- RQ4包含特定 AD 相关关键词(如 APOE、淀粉样蛋白 β)在多大程度上影响模型性能?当前 QA 基准中哪些关键词代表性不足?
- RQ5在高风险、知识密集型领域(如阿尔茨海默病)中,一种轻量级、无需微调的协同增强框架,是否能有效提升 LLM 性能,而无需进行模型微调?
主要发现
- DALK 在 ADQA 基准上取得了 72.6% 的 F1 分数,显著优于基线模型,包括检索增强型与领域专用 LLM,验证了动态协同增强的有效性。
- 与无自我意识检索的基线相比,自我意识知识检索方法将性能提升了 2.0 个百分点(从 70.6% 提升至 72.6%),凸显其在降低噪声与提升相关性方面的关键作用。
- 移除如 'APOE' 和 'Amyloid beta' 等特定 AD 相关关键词后,性能出现显著下降(分别降至 73.2% 和 73.5% 的 F1),表明这些关键词在 AD 知识表征中具有关键作用。
- 敏感性分析显示,'脑脊液生物标志物'(CSF Biomarkers)与 '神经发生'(Neurogenesis)等关键词在 ADQA 基准中基本缺失,提示需针对性地收集数据以提升基准覆盖度。
- 从粗到细的采样方法有效减少了子图大小与噪声,尤其对长查询更为显著,否则将导致更大更嘈杂的子图,从而损害性能。
- 消融实验表明,若从查询上下文中移除 'Alzheimer' 或 'Dementia',性能出现轻微下降,表明这些术语在将查询锚定于 AD 领域中具有重要作用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。