[论文解读] Large Language Models for Biomedical Knowledge Graph Construction: Information extraction from EMR notes
本文提出一种基于大语言模型(LLMs)的端到端方法,用于从电子病历(EMR)笔记中自动构建生物医学知识图谱,重点关注疾病、治疗、影响因素和体征之间的关系。研究在不同架构的12种LLM上进行了评估,发现仅解码器架构的模型需要引导式提示才能生成结构化输出,并在年龄相关性黄斑变性病例上通过人工标注数据集验证了该方法的有效性。
The automatic construction of knowledge graphs (KGs) is an important research area in medicine, with far-reaching applications spanning drug discovery and clinical trial design. These applications hinge on the accurate identification of interactions among medical and biological entities. In this study, we propose an end-to-end machine learning solution based on large language models (LLMs) that utilize electronic medical record notes to construct KGs. The entities used in the KG construction process are diseases, factors, treatments, as well as manifestations that coexist with the patient while experiencing the disease. Given the critical need for high-quality performance in medical applications, we embark on a comprehensive assessment of 12 LLMs of various architectures, evaluating their performance and safety attributes. To gauge the quantitative efficacy of our approach by assessing both precision and recall, we manually annotate a dataset provided by the Macula and Retina Institute. We also assess the qualitative performance of LLMs, such as the ability to generate structured outputs or the tendency to hallucinate. The results illustrate that in contrast to encoder-only and encoder-decoder, decoder-only LLMs require further investigation. Additionally, we provide guided prompt design to utilize such LLMs. The application of the proposed methodology is demonstrated on age-related macular degeneration.
研究动机与目标
- 开发一种端到端的机器学习解决方案,用于从EMR笔记中自动构建生物医学知识图谱。
- 评估12种不同LLM架构在临床关系抽取任务中的性能与安全性。
- 解决在医疗NLP中,仅解码器LLM生成结构化输出的挑战。
- 提供一种引导式提示设计框架,以增强仅解码器LLM在知识图谱构建中的实用性。
- 通过人工标注数据集,验证该方法在年龄相关性黄斑变性病例中的适用性。
提出的方法
- 使用12种具有不同架构(仅编码器、编码器-解码器、仅解码器)的LLM,从EMR笔记中进行关系抽取。
- 采用来自黄斑与视网膜研究所的私有、人工标注数据集,用于在临床关系抽取任务中进行性能基准测试。
- 应用基于指令的提示和 few-shot 提示策略,以改善结构化输出生成,尤其针对仅解码器模型。
- 专注于提取医疗实体之间的有向关系,类型为 'coexists_with',包括疾病、治疗、影响因素和体征。
- 同时进行定量评估(精确率、召回率)和定性分析(幻觉、输出结构)以评估LLM的行为。
- 采用端到端的处理流程:处理EMR笔记以识别实体和关系,然后构建包含节点和带标签边的有向知识图谱。
实验结果
研究问题
- RQ1哪些LLM架构在从EMR笔记中提取结构化医疗关系方面表现最佳?
- RQ2不同LLM架构在临床关系抽取中的精确率、召回率和幻觉率方面有何差异?
- RQ3引导式提示能否有效使仅解码器LLM生成适合知识图谱构建的结构化输出?
- RQ4在临床知识图谱构建中部署LLM时,存在哪些安全与可靠性方面的担忧?
- RQ5所提出方法在构建特定疾病(如年龄相关性黄斑变性)的知识图谱方面效果如何?
主要发现
- 仅解码器LLM需要引导式提示才能生成适合知识图谱构建的结构化输出,而仅编码器和编码器-解码器模型则无需此要求。
- FLAN-T5-XXL 和 FLAN-UL2 模型在基于指令和 few-shot 提示下表现优异,多个测试案例中均成功提取了正确的关系。
- 研究发现,微调于公开数据集(如 MIMIC-III)的模型可能存在偏差或泛化能力不足,因此评估采用了私有、人工标注的数据集。
- 引导式提示显著提升了关系抽取的可靠性和一致性,尤其对仅解码器模型效果明显。
- 该方法成功构建了年龄相关性黄斑变性的知识图谱,识别出关键关系如 'AREDS 和 WACS 维生素' 与 '病理性黄斑变性' 共存。
- 定性分析显示,若缺乏适当提示,仅解码器模型普遍存在幻觉和非结构化输出问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。