[论文解读] Deep-learning models in medical image analysis: Detection of esophagitis from the Kvasir Dataset
本研究评估了四种深度学习模型——GoogLeNet、ResNet-50、MobileNet V2 和 MobileNet V3——在 Kvasir 数据集的内镜图像中检测食管炎的表现。GoogLeNet 的 F1 分数最高(0.843),而 MobileNet V3 在真正例率(0.950)和精确率(0.901)方面表现最佳,表明其在食管炎检测中具有更高的置信度和准确性。Grad-CAM 和 SHAP 等可解释性技术揭示了模型对临床相关黏膜撕裂的关注。
Early detection of esophagitis is important because this condition can progress to cancer if left untreated. However, the accuracies of different deep learning models in detecting esophagitis have yet to be compared. Thus, this study aimed to compare the accuracies of convolutional neural network models (GoogLeNet, ResNet-50, MobileNet V2, and MobileNet V3) in detecting esophagitis from the open Kvasir dataset of endoscopic images. Results showed that among the models, GoogLeNet achieved the highest F1-scores. Based on the average of true positive rate, MobileNet V3 predicted esophagitis more confidently than the other models. The results obtained using the models were also compared with those obtained using SHapley Additive exPlanations and Gradient-weighted Class Activation Mapping.
研究动机与目标
- 比较四种最先进的卷积神经网络模型(GoogLeNet、ResNet-50、MobileNet V2 和 MobileNet V3)在内镜图像中检测食管炎的诊断准确性。
- 使用标准指标(准确率、精确率、召回率、F1 分数)在公开的 Kvasir 数据集上评估模型性能。
- 利用 Grad-CAM 和 SHAP 分析模型可解释性,评估模型是否关注如黏膜撕裂等临床相关特征。
- 确定哪种模型在准确性、计算效率和临床置信度之间达到最佳平衡,适用于食管炎检测。
提出的方法
- 在 Kvasir 内镜图像数据集上对四种预训练的卷积神经网络模型(GoogLeNet、ResNet-50、MobileNet V2 和 MobileNet V3)进行微调,用于食管炎与 z-line 的二分类任务。
- 使用标准评估指标:基于混淆矩阵(TP、FP、TN、FN)计算的准确率、精确率、召回率、特异性及 F1 分数。
- 应用 Grad-CAM 可视化注意力图,突出对分类决策最具影响力的图像区域。
- 采用 SHAP 计算特征级别的贡献度,识别支持或否定食管炎预测的图像块。
- 将模型预测与真实标签进行对比,并分析假阴性案例,以评估模型的可靠性与可解释性。
- 通过测试图像中平均真正例率评估模型置信度,以衡量预测的一致性。
实验结果
研究问题
- RQ1在 Kvasir 数据集中,哪种深度学习模型在从内镜图像检测食管炎时获得最高的 F1 分数?
- RQ2MobileNet V3 在分类食管炎时的精确率和真正例率相较于其他模型表现如何?
- RQ3Grad-CAM 和 SHAP 在多大程度上解释了模型的决策过程?哪种方法更能精确定位临床相关特征?
- RQ4模型是否如准确诊断所要求的那样,关注 z-line 附近的解剖学特征(如黏膜撕裂)?
主要发现
- GoogLeNet 达到了最高的 F1 分数 0.843,表明其在所有模型中精度与召回率的平衡最佳。
- MobileNet V3 的平均真正例率达到最高(0.950),表明其在检测食管炎时最具置信度。
- MobileNet V3 同时实现了最高的精确率(0.901)和特异性(0.908),表明其在阳性预测中具有极强的可靠性。
- SHAP 分析显示,与 Grad-CAM 相比,MobileNet V3 更准确地识别出多个黏膜撕裂,尤其是在高置信度预测中。
- 在假阴性案例中,SHAP 正确地将炎症区域识别为对 z-line 预测的负面贡献因素,表明模型虽误分类,但对疾病特征具有认知。
- Grad-CAM 在假阴性案例中表现出梯度饱和,导致激活区域扩散,可解释性低于 SHAP。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。