Skip to main content
QUICK REVIEW

[论文解读] GPT-4 Vision on Medical Image Classification -- A Case Study on COVID-19 Dataset

Ruibo Chen, Tianyi Xiong|arXiv (Cornell University)|Oct 27, 2023
COVID-19 diagnosis using AI被引用 4
一句话总结

本研究探讨了将 GPT-4V(一种视觉-语言基础模型)应用于基于上下文学习的 COVID-19 胸部 X 光片分类。通过设计任务特定的提示,GPT-4V 在少样本设置下实现了与微调的卷积神经网络(如 ResNet-18 和 VGG-16)相当的分类准确率,展示了大型模型在医学影像领域绕过传统数据密集型训练范式的潜力。

ABSTRACT

This technical report delves into the application of GPT-4 Vision (GPT-4V) in the nuanced realm of COVID-19 image classification, leveraging the transformative potential of in-context learning to enhance diagnostic processes.

研究动机与目标

  • 探索在不进行微调的情况下,使用 GPT-4V 这类大型视觉-语言基础模型进行医学图像分类的可行性。
  • 评估通过精心设计的提示进行上下文学习,是否能使 GPT-4V 在少样本设置下达到或超越传统深度学习模型的性能。
  • 研究提示工程(包括推理解释)对 GPT-4V 在医学影像分类中性能的影响。
  • 在真实世界的 COVID-19 胸部 X 光片数据集上,比较 GPT-4V 与已建立的基于卷积神经网络的模型(ResNet-18、VGG-16)在全量和少样本训练设置下的表现。

提出的方法

  • 本研究采用上下文学习(ICL)方法,通过包含图像分类输入-输出示范的提示模板引导 GPT-4V。
  • 设计了多种提示变体(ICL1 至 ICL4,ICL-R1,ICL-R2),其任务特异性、结构和推理理由的包含程度各不相同。
  • 提示被构建以嵌入临床背景和分类规则,利用 GPT-4V 的预训练知识实现零样本或少样本适应。
  • 图像被单独处理或整合为单个输入图像,以评估模型的关注度和性能一致性。
  • 基线模型(ResNet-18 和 VGG-16)在完整数据集和 6 个样本子集上进行了微调,以确保公平比较。
  • 评估指标包括测试集(共 46 张 X 光片,26 例 COVID,20 例正常)上的精确率、召回率、F1 分数和总体准确率。

实验结果

研究问题

  • RQ1GPT-4V 是否仅通过上下文学习即可在医学图像上实现具有竞争力的分类准确率,而无需任何微调?
  • RQ2提示设计(特别是结构、推理解释的包含以及图像整合)如何影响 GPT-4V 在少样本医学图像分类中的表现?
  • RQ3在提示中整合推理解释是否能提升 GPT-4V 在医学 X 光片分类中的准确率?
  • RQ4在全量和少样本训练条件下,GPT-4V 的表现与微调的卷积神经网络(ResNet-18、VGG-16)相比如何?

主要发现

  • 使用 ICL4 提示的 GPT-4V 实现了 85% 的总体准确率,优于 6 个样本微调的 ResNet-18(74%)和 VGG-16(80%)基线模型。
  • ICL4 提示变体在 COVID 类别上实现了 0.85 的 F1 分数,在正常类别上实现了 0.84 的 F1 分数,表明其在两类中的泛化能力均较强。
  • 将所有图像整合为单个输入可提升性能,表明 GPT-4V 在此设置下注意力分布更优。
  • 在提示中添加推理解释(ICL-R1、ICL-R2)并未提升性能,有时甚至导致结果下降,表明提供的推理理由与模型理解之间可能存在错位。
  • 使用 ICL4 的 GPT-4V 在正常类别上实现了 95% 的精确率和 95% 的召回率,优于全量微调的 ResNet-18(95% 精确率,90% 召回率),并达到与 VGG-16 基线(100% 精确率,92% 召回率)相当的水平。
  • 模型在多个随机种子下表现一致,平均结果基于五次运行报告,表明其在少样本设置下具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。