Skip to main content
QUICK REVIEW

[论文解读] Can Large Language Models Challenge CNNs in Medical Image Analysis?

Shibbir Ahmed, Shahnewaz Karim Sakib|ArXiv.org|May 29, 2025
Radiomics and Machine Learning in Medical Imaging被引用 3
一句话总结

本论文在X光、MRI和CT数据集上对CNN与LLM(GPT-4o 与 Llama3.2-vision)在医学影像分类任务中的表现进行比较,结果显示CNN通常优于LLM,而增强的数据筛选可提升LLM的表现与效率。

ABSTRACT

This study presents a multimodal AI framework designed for precisely classifying medical diagnostic images. Utilizing publicly available datasets, the proposed system compares the strengths of convolutional neural networks (CNNs) and different large language models (LLMs). This in-depth comparative analysis highlights key differences in diagnostic performance, execution efficiency, and environmental impacts. Model evaluation was based on accuracy, F1-score, average execution time, average energy consumption, and estimated $CO_2$ emission. The findings indicate that although CNN-based models can outperform various multimodal techniques that incorporate both images and contextual information, applying additional filtering on top of LLMs can lead to substantial performance gains. These findings highlight the transformative potential of multimodal AI systems to enhance the reliability, efficiency, and scalability of medical diagnostics in clinical settings.

研究动机与目标

  • 在多样化的医学影像数据集(X-ray、MRI、CT)上基准CNN和LLM。
  • 分析CNN和LLM的计算效率与环境影响。
  • 研究增强数据筛选以提升LLM分类可靠性与效率。
  • 评估临床情境下模型预测的置信度校准与可靠性。

提出的方法

  • 在胸部X光、脑部MRI和胸部CT数据集上评估CNN和LLM体系结构(GPT-4o、Llama3.2-vision)。
  • 以准确率、F1分数和平均置信度作为性能指标。
  • 测量平均执行时间、能耗和预计的CO2排放以评估资源利用效率。
  • 实现多阶段数据筛选管线,通过上下文特征和有针对性的问题提升LLM的分类效果。
Fig. 3 : Context Aggregation and Question Formulation
Fig. 3 : Context Aggregation and Question Formulation

实验结果

研究问题

  • RQ1CNN和LLM在不同医学影像模态下的准确性和F1分数的对比如何?
  • RQ2在预测性能与计算资源使用之间,CNN与LLM存在哪些权衡?
  • RQ3增强的数据筛选是否能提升LLM在医学影像任务中的诊断性能与效率?
  • RQ4相较于CNN,LLM的置信分数是否显示出更高的预测可靠性?

主要发现

  • 在三个模态的准确性和F1分数方面,CNN均优于LLM(胸部X光:CNN 0.83 vs GPT-4o 0.62;MRI:CNN 0.98+ vs GPT-4o 0.60;胸部CT:CNN 0.91 vs GPT-4o 0.22)。
  • GPT-4o获得的平均置信分数高于CNN,但准确性远低,显示在错误处的过度自信。
  • Llama3.2-vision的准确性中等(胸部X光0.65;MRI 0.52;胸部CT 0.50)且置信分数相对较高,但仍低于CNN表现。
  • 针对LLM的增强数据筛选(含上下文问题)将胸部X光的准确性从62%提升至82.01%,将平均执行时间从6.23秒降至2.35秒,能耗从1.84到1.65W-H。
  • CNN在所有数据集上均展现最佳的计算效率(最低的执行时间、能耗与CO2排放);LLM成本较高,尤其是Llama3.2-vision。
  • 表2显示对GPT-4o筛选后带来显著提升(无筛选时准确度62%,筛选后82.01%;时间6.23秒对2.35秒;能耗1.84W-H对1.65W-H)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。