[论文解读] ChatGPT-HealthPrompt. Harnessing the Power of XAI in Prompt-Based Healthcare Decision Support using ChatGPT
本文提出 ChatGPT-HealthPrompt,一种新颖的框架,通过将可解释机器学习模型(如 XGBoost)的领域知识整合到 OpenAI 的 ChatGPT 的提示工程中,增强临床决策支持。通过将特征重要性洞察作为上下文提示,该方法在少样本设置下实现了与传统监督模型相当的性能——即使在数据量有限的情况下亦然——表明 AI 增强的提示设计能显著提升医疗应用中的准确性和可解释性。
This study presents an innovative approach to the application of large language models (LLMs) in clinical decision-making, focusing on OpenAI's ChatGPT. Our approach introduces the use of contextual prompts-strategically designed to include task description, feature description, and crucially, integration of domain knowledge-for high-quality binary classification tasks even in data-scarce scenarios. The novelty of our work lies in the utilization of domain knowledge, obtained from high-performing interpretable ML models, and its seamless incorporation into prompt design. By viewing these ML models as medical experts, we extract key insights on feature importance to aid in decision-making processes. This interplay of domain knowledge and AI holds significant promise in creating a more insightful diagnostic tool. Additionally, our research explores the dynamics of zero-shot and few-shot prompt learning based on LLMs. By comparing the performance of OpenAI's ChatGPT with traditional supervised ML models in different data conditions, we aim to provide insights into the effectiveness of prompt engineering strategies under varied data availability. In essence, this paper bridges the gap between AI and healthcare, proposing a novel methodology for LLMs application in clinical decision support systems. It highlights the transformative potential of effective prompt design, domain knowledge integration, and flexible learning approaches in enhancing automated decision-making.
研究动机与目标
- 研究在不进行微调的情况下,使用类似 ChatGPT 的大语言模型进行二分类临床决策支持的可行性。
- 探讨如何通过整合来自可解释机器学习模型(如 XGBoost、随机森林)的领域特定知识,提升医疗领域中的提示推理性能。
- 在医疗分类任务中,比较零样本提示与少样本提示策略在性能、可靠性及误报/漏报错误特征(FP/FN)方面的表现。
- 评估是否可通过专家衍生洞察的提示工程,缩小大语言模型与传统监督模型之间的性能差距,特别是在数据稀缺环境中。
- 评估基于大语言模型的诊断系统中,误报与漏报之间的权衡关系,及其对临床安全的影响。
提出的方法
- 该方法构建包含任务描述、输入特征描述以及从高性能可解释机器学习模型(如 XGBoost、随机森林、逻辑回归)中提取的领域知识的上下文提示。
- 领域知识源自训练好的可解释模型的特征重要性分数(MLFI)和有序特征重要性(MLFI-ord),并作为推理线索嵌入提示中。
- 该框架采用少样本提示策略,在提示中包含 8 个或 16 个标注示例,每个示例以病例叙述格式呈现,包含临床特征和二元结果(如是否存在心脏病)。
- 零样本提示用作基线,仅提供任务指令和输入,不包含任何示例。
- 性能通过标准指标进行评估:在多种提示变体和模型配置下,使用准确率、F1 分数、精确率、召回率以及假阳性和假阴性率。
- 该方法将训练好的可解释模型视为“医学专家”,以提取可操作的洞察,并以人类可解释的格式引导大语言模型的推理过程。

实验结果
研究问题
- RQ1从可解释机器学习模型中提取的领域知识,是否能显著提升大语言模型在临床决策支持中基于提示的少样本推理性能?
- RQ2在不同数据可用性水平下,ChatGPT 在零样本和少样本提示下的表现与传统监督机器学习模型相比如何?
- RQ3将 XGBoost 及其他模型的特征重要性和有序特征重要性整合到提示中,对大语言模型生成预测的可靠性与可解释性有何影响?
- RQ4基于大语言模型的提示与经典机器学习模型在误报率和漏报率方面有何差异?这些错误特征的临床意义是什么?
- RQ5通过专家衍生洞察的提示工程,能在多大程度上降低大语言模型在医疗应用中的数据依赖性?
主要发现
- 在包含 16 个示例的少样本场景中,ChatGPT-HealthPrompt 的平均 F1 分数达到 0.8193,部分配置下性能接近或超过传统监督模型。
- 通过 MLFI 和 MLFI-ord 特征整合领域知识可提升模型性能,当使用 XGBoost 衍生的洞察时,最佳 F1 分数达到 0.9267。
- ChatGPT 显著优于零样本基线,当使用 16 个示例时,平均 F1 分数从零样本的 0.7608 提升至 0.8193。
- 尽管在少样本设置下的假阳性率(FP)高于经典模型——平均为 11.54——但假阴性率保持较低水平,表明在高风险诊断中具有更安全的错误特征。
- 当使用基于 XGBoost 的提示并包含 16 个示例时,模型达到最高准确率 0.9428 和 F1 分数 0.9428,表明在数据稀缺条件下仍表现出强劲性能。
- 在提示中使用有序特征重要性(MLFI-ord)的配置中,F1 分数达到最高(0.9267),表明结构化的特征排序可增强大语言模型的推理能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。