Skip to main content
QUICK REVIEW

[论文解读] Large Language Models Streamline Automated Machine Learning for Clinical Studies

Soroosh Tayebi Arasteh, Tianyu Han|arXiv (Cornell University)|Aug 27, 2023
Machine Learning in Healthcare被引用 6
一句话总结

本研究评估了基于大型语言模型(LLM)的工具ChatGPT Advanced Data Analysis(ADA),用于在临床研究中自主开发机器学习模型。在无需专门训练的情况下,ChatGPT ADA在四个真实世界临床试验中生成的模型性能达到或超过人工构建的基准模型,准确率和可靠性均较高,能够有效预测癌症进展和生物标志物等临床结局。

ABSTRACT

A knowledge gap persists between machine learning (ML) developers (e.g., data scientists) and practitioners (e.g., clinicians), hampering the full utilization of ML for clinical data analysis. We investigated the potential of the ChatGPT Advanced Data Analysis (ADA), an extension of GPT-4, to bridge this gap and perform ML analyses efficiently. Real-world clinical datasets and study details from large trials across various medical specialties were presented to ChatGPT ADA without specific guidance. ChatGPT ADA autonomously developed state-of-the-art ML models based on the original study's training data to predict clinical outcomes such as cancer development, cancer progression, disease complications, or biomarkers such as pathogenic gene sequences. Following the re-implementation and optimization of the published models, the head-to-head comparison of the ChatGPT ADA-crafted ML models and their respective manually crafted counterparts revealed no significant differences in traditional performance metrics (P>0.071). Strikingly, the ChatGPT ADA-crafted ML models often outperformed their counterparts. In conclusion, ChatGPT ADA offers a promising avenue to democratize ML in medicine by simplifying complex data analyses, yet should enhance, not replace, specialized training and resources, to promote broader applications in medical research and practice.

研究动机与目标

  • 评估类似ChatGPT ADA的大型语言模型是否能够无需专门的机器学习训练,自主开发适用于临床数据的高性能机器学习模型。
  • 评估LLM生成模型与人工构建的专家推荐模型在真实世界临床试验数据集中的可靠性与有效性。
  • 探究非专家临床医生是否能够有效利用LLM在医学研究中执行复杂的机器学习分析。
  • 确定LLM是否能够在保持模型性能与可解释性的前提下,简化临床环境中的自动化机器学习(AutoML)。

提出的方法

  • 将来自四项大型多学科临床试验的真实世界临床数据集输入ChatGPT ADA,仅使用最少提示(例如:'分析这些患者数据并构建一个预测12个月死亡率的机器学习模型')。
  • ChatGPT ADA根据数据特征和任务需求,自主选择并实现机器学习模型,主要为随机森林(Random Forest)和LightGBM。
  • LLM生成了用于数据预处理、模型训练、超参数选择和评估的Python代码,包括模型解释与结果格式化。
  • 通过标准指标(如AUC、准确率)评估模型性能,并与原始发表模型及专家数据科学家重新实现的版本进行比较。
  • 从LLM的内部推理和响应中提取超参数细节、验证策略和数据缩放决策,以评估方法论的严谨性。
  • 对LLM生成模型与人工重新实现模型进行了对比分析,以评估统计等价性与性能差异。

实验结果

研究问题

  • RQ1ChatGPT ADA是否能够在无专家指导的情况下,从原始临床试验数据中自主生成具有临床相关性的机器学习模型?
  • RQ2LLM生成模型的性能指标与真实世界临床数据集中人工构建的专家推荐模型相比如何?
  • RQ3LLM的模型选择与超参数配置是否符合机器学习中的最佳实践,特别是在验证与正则化方面?
  • RQ4非技术背景的临床医生在多大程度上可以利用LLM(如ChatGPT ADA)在医学研究中执行高级数据分析?
  • RQ5在高风险临床应用中依赖LLM进行模型开发存在哪些局限性与风险?

主要发现

  • ChatGPT ADA成功为四个不同专科的临床试验(包括癌症进展、疾病并发症和生物标志物预测)生成了机器学习模型。
  • LLM生成模型的性能与人工重新实现模型相比无统计学显著差异,所有比较的p值均≥0.072。
  • 在多个案例中,LLM生成的模型在AUC和准确率方面优于其人工构建的对应模型,表明其具有潜在的更优泛化能力。
  • LLM选择了合适的算法(如随机森林、LightGBM),并清晰解释了超参数选择的合理性,如n_estimators=1000和min_samples_leaf=1。
  • ChatGPT ADA正确识别出树基模型无需数据缩放,并解释了其背后的原理,显示出对模型特异性需求的理解。
  • LLM承认初始运行中缺乏网格搜索或显式验证集划分,表明其对最佳实践的认知以及潜在改进空间的意识。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。