[论文解读] Automated Clinical Data Extraction with Knowledge Conditioned LLMs
本文提出了一种基于知识的两阶段大语言模型框架,用于从临床报告中自动提取肺部病灶数据,利用上下文学习(ICL)将动态生成的内部知识与专家整理的外部知识对齐。与现有ICL方法相比,该方法在关键字段(大小、边缘、密度)上的F1分数提升了12.9%,显著提高了临床自然语言处理应用中的准确性并减少了幻觉现象。
The extraction of lung lesion information from clinical and medical imaging reports is crucial for research on and clinical care of lung-related diseases. Large language models (LLMs) can be effective at interpreting unstructured text in reports, but they often hallucinate due to a lack of domain-specific knowledge, leading to reduced accuracy and posing challenges for use in clinical settings. To address this, we propose a novel framework that aligns generated internal knowledge with external knowledge through in-context learning (ICL). Our framework employs a retriever to identify relevant units of internal or external knowledge and a grader to evaluate the truthfulness and helpfulness of the retrieved internal-knowledge rules, to align and update the knowledge bases. Experiments with expert-curated test datasets demonstrate that this ICL approach can increase the F1 score for key fields (lesion size, margin and solidity) by an average of 12.9% over existing ICL methods.
研究动机与目标
- 为解决因缺乏领域特定知识而导致的大语言模型在临床数据提取中产生幻觉和准确率低下的问题。
- 提升从非结构化放射科报告中提取细微肺部病灶特征(如边缘、密度)的可靠性。
- 开发一种可扩展的迭代方法,实现自动生成的内部知识与权威外部医学知识的对齐。
- 通过自动化病灶发现的结构化提取,减少临床研究和放射科工作流程中的手动工作量。
提出的方法
- 该框架采用两阶段流程:第一阶段检测肺部病灶发现并解析主要结构化字段,第二阶段进一步将非结构化的病灶描述文本解析为详细字段。
- 从经过筛选的医学报告语料库中自动生成内部知识库,将相关参考文献转化为更高层次的提取规则。
- 检索器根据输入报告选择相关的内部知识规则,而评分模块则利用外部专家知识评估这些规则的真实性与有用性。
- 通过上下文学习(ICL)将检索到且经过评分的规则提示给大语言模型,以提升提取结果的准确性和一致性。
- 在第二阶段采用受控词汇表,以指导对复杂嵌套病灶描述的结构化字段解析。
- 外部知识仅用于验证和更新内部知识库,从而在不改变核心架构的前提下实现动态优化。

实验结果
研究问题
- RQ1通过动态对齐的内部知识与外部知识进行上下文学习,是否能减少大语言模型在临床数据提取中的幻觉?
- RQ2知识引导的提示方法在提取如边缘和密度等细微肺部病灶特征方面,如何提升准确性?
- RQ3自更新的内部知识库在临床自然语言处理任务中,与静态ICL或检索增强生成(RAG)方法相比,其性能优势在多大程度上得以体现?
- RQ4与端到端方法相比,两阶段解析方法是否能更有效地提取嵌套的复杂病灶描述?
- RQ5专家整理的外部知识整合如何提升大语言模型生成的临床数据提取结果的可靠性?
主要发现
- 所提出的框架相较于现有ICL方法,使关键病灶字段(病灶大小、边缘、密度)的F1分数平均提升了12.9%。
- 该方法在检测临床相关发现方面表现出更高的可靠性,显著减少了大语言模型输出中的幻觉。
- 两阶段解析方法通过应用专门的提示策略和受控词汇表,实现了对嵌套病灶描述字段更准确的提取。
- 评分模块虽目前为预训练模型且未进行微调,但仍能有效评估检索到的知识规则的真实性与有用性。
- 该系统的架构支持轻松集成更新或更优的外部知识源,而无需修改核心模型。
- 该框架在提取复杂且领域特定的临床属性方面,优于标准的RAG和ICL基线方法。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。