Skip to main content
QUICK REVIEW

[论文解读] Interpretable Medical Diagnostics with Structured Data Extraction by Large Language Models

Aleksa Bisercic, Mladen Nikolić|arXiv (Cornell University)|Jun 8, 2023
Topic Modeling被引用 7
一句话总结

本文提出 TEMED-LLM,一种新颖方法,利用大语言模型(LLMs)通过领域特定的推理准则和反馈回路进行验证与修正,从非结构化医学报告中提取结构化表格数据。该方法在诊断性能上优于最先进文本分类器,同时通过决策树和逻辑回归等表格化机器学习模型实现可解释的预测。

ABSTRACT

Tabular data is often hidden in text, particularly in medical diagnostic reports. Traditional machine learning (ML) models designed to work with tabular data, cannot effectively process information in such form. On the other hand, large language models (LLMs) which excel at textual tasks, are probably not the best tool for modeling tabular data. Therefore, we propose a novel, simple, and effective methodology for extracting structured tabular data from textual medical reports, called TEMED-LLM. Drawing upon the reasoning capabilities of LLMs, TEMED-LLM goes beyond traditional extraction techniques, accurately inferring tabular features, even when their names are not explicitly mentioned in the text. This is achieved by combining domain-specific reasoning guidelines with a proposed data validation and reasoning correction feedback loop. By applying interpretable ML models such as decision trees and logistic regression over the extracted and validated data, we obtain end-to-end interpretable predictions. We demonstrate that our approach significantly outperforms state-of-the-art text classification models in medical diagnostics. Given its predictive performance, simplicity, and interpretability, TEMED-LLM underscores the potential of leveraging LLMs to improve the performance and trustworthiness of ML models in medical applications.

研究动机与目标

  • 解决从包含临床记录和诊断摘要的非结构化医学报告中提取结构化表格特征的挑战。
  • 克服传统基于文本的机器学习模型在处理模糊、上下文依赖及术语密集的医学语言时的局限性。
  • 开发一种结合 LLM 推理与数据验证的方法,以提高数据提取的准确性和可靠性。
  • 通过在 LLM 提取的数据上应用可解释的表格化模型,实现端到端可解释的医学诊断。
  • 证明基于 LLM 的数据提取在医学诊断任务中优于最先进文本分类模型。

提出的方法

  • TEMED-LLM 使用大语言模型(LLMs)基于预定义的特征模式,从文本医学报告中提取表格化特征。
  • 该方法引入领域特定的推理准则,指导 LLM 在特征名称未明确提及的情况下推断特征。
  • 提出一种新颖的数据验证与推理校正反馈回路,通过迭代方式提升提取质量并检测不一致性。
  • 提取的表格化数据通过可解释的机器学习模型(如决策树和逻辑回归)进行处理,实现透明、人类可读的预测。
  • 该流程将 LLM 用于结构化数据提取与经典表格化机器学习模型相结合,确保高性能与可解释性兼具。
  • 文本分类器与表格化模型的超参数通过网格搜索进行调优,模型使用标准自然语言处理与机器学习库进行训练。

实验结果

研究问题

  • RQ1LLM 是否能有效从非结构化医学报告中提取结构化表格特征,即使特征名称未被明确提及?
  • RQ2推理准则与反馈回路的整合是否显著提升了从临床文本中提取表格化数据的准确性和可靠性?
  • RQ3基于 LLM 的数据提取在医学诊断任务中的表现与最先进文本分类模型相比如何?
  • RQ4在 LLM 提取的数据上使用可解释的表格化模型,在多大程度上增强了模型的透明度与临床可信度?
  • RQ5所提出的方法是否能在多种医学诊断任务和真实世界电子健康记录中实现泛化?

主要发现

  • TEMED-LLM 在多个医学诊断任务中显著优于最先进文本分类模型,包括 BioBERT、RoBERTa 和 XLM-RoBERTa。
  • 使用领域特定推理准则与用于验证和校正的反馈回路,提升了数据提取质量,使在缺乏显式特征名称的情况下仍能准确推断表格化特征成为可能。
  • 在 LLM 提取数据上训练的决策树模型性能与在真实表格数据上训练的模型相当,如图 3 所示,证明了数据提取过程的高保真度。
  • 在提取数据上应用逻辑回归与 XGBoost 模型,产生了可解释的预测结果,并清晰展示了特征重要性,增强了临床信任与模型透明度。
  • 该方法在公开数据集和临床医生提供的真实电子健康记录中均表现出强劲性能,证实了其实际适用性。
  • 结合 LLM 数据提取与可解释表格化建模的端到端流程,在保持模型可解释性的同时实现了高性能预测,这是相较于黑箱 NLP 模型的关键优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。