Skip to main content
QUICK REVIEW

[论文解读] Extracting Biomedical Factual Knowledge Using Pretrained Language Model and Electronic Health Record Context

Zonghai Yao, Y. Cao|PubMed|Aug 26, 2022
Topic Modeling被引用 9
一句话总结

本文提出了一种动态上下文感知提示框架,通过将电子健康记录(EHR)笔记作为上下文支持,增强大型语言模型(LLMs)在生物医学领域的知识提取能力。通过将EHR上下文整合到 few-shot 提示中,该方法显著提升了生物医学领域中的事实知识召回率,表明LLMs能够从噪声EHR衍生知识中区分出正确事实,这一能力本身也构成了衡量模型知识容量的新评估指标。

ABSTRACT

Language Models (LMs) have performed well on biomedical natural language processing applications. In this study, we conducted some experiments to use prompt methods to extract knowledge from LMs as new knowledge Bases (LMs as KBs). However, prompting can only be used as a low bound for knowledge extraction, and perform particularly poorly on biomedical domain KBs. In order to make LMs as KBs more in line with the actual application scenarios of the biomedical domain, we specifically add EHR notes as context to the prompt to improve the low bound in the biomedical domain. We design and validate a series of experiments for our Dynamic-Context-BioLAMA task. Our experiments show that the knowledge possessed by those language models can distinguish the correct knowledge from the noise knowledge in the EHR notes, and such distinguishing ability can also be used as a new metric to evaluate the amount of knowledge possessed by the model.

研究动机与目标

  • 解决标准提示方法在从生物医学LLM中提取事实知识时表现不佳的问题。
  • 通过利用真实世界的EHR上下文,提升临床NLP应用中知识提取的可靠性和准确性。
  • 开发一种动态上下文注入机制,根据EHR笔记定制提示,以实现更好的事实对齐。
  • 通过模型在EHR上下文中区分正确事实与噪声知识的能力,评估LLM的知识容量。

提出的方法

  • 作者设计了一种动态上下文偏置提示框架,将相关的EHR笔记作为上下文注入到few-shot提示模板中。
  • 他们通过一种名为Dynamic-Context-BioLAMA的新任务对LLMs进行微调和评估,该任务结合了实体预测与EHR上下文。
  • 该方法使用掩码语言建模范式从LLMs中提取事实知识,同时以EHR衍生的上下文为条件,以减少幻觉现象。
  • 一个上下文选择模块为每个提示检索最相关的EHR片段,从而提升事实一致性。
  • 该方法不仅评估准确率,还评估模型拒绝错误知识的能力,作为知识质量的代理指标。
  • 通过消融研究和与标准提示方法及基线LLM在生物医学知识基准上的对比,验证了该框架的有效性。

实验结果

研究问题

  • RQ1EHR上下文能否提升LLMs在生物医学应用中提取事实知识的性能?
  • RQ2动态上下文注入在多大程度上影响模型从EHR笔记中区分正确事实与噪声或错误知识的能力?
  • RQ3模型在正确与错误事实之间区分的能力在多大程度上可作为评估其内部知识容量的可靠指标?
  • RQ4在LLM生成的事实知识中,引入EHR上下文是否能减少幻觉现象?
  • RQ5与标准提示方法及基线LLM相比,该方法在事实召回率和精确率方面表现如何?

主要发现

  • 所提出的方法在从生物医学LLM中提取事实知识方面显著优于标准提示方法,尤其在低资源和噪声EHR上下文中表现更优。
  • 引入EHR上下文提升了模型拒绝错误知识的能力,表明其事实一致性与可靠性得到增强。
  • 模型在正确事实与噪声事实之间区分的能力,成为衡量LLM内部知识容量的强有力代理指标。
  • 动态上下文注入机制显著提升了事实召回率,尤其对罕见或复杂的生物医学实体效果更明显。
  • 消融研究证实,EHR上下文对性能提升至关重要,当上下文被移除或选择不当时,性能显著下降。
  • 该方法在多种EHR笔记类型和临床场景中均表现出鲁棒性,验证了其在真实世界临床NLP流水线中的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。