[论文解读] Classification of Diabetic Retinopathy using Pre-Trained Deep Learning Models
本研究提出了一种基于微调预训练深度学习模型(VGG-16、MobileNet、InceptionV3 和 InceptionResNetV2)的计算机辅助诊断系统,用于将糖尿病性视网膜病变(DR)进行五类分类(正常至增殖性DR)。利用来自Kaggle数据集的1,000张眼底图像,结合数据增强和迁移学习,InceptionResNetV2在AUC上达到最高值0.69,优于其他模型,归因于其深度和在医学图像分类中的架构效率。
Diabetic Retinopathy (DR) stands as the leading cause of blindness globally, particularly affecting individuals between the ages of 20 and 70. This paper presents a Computer-Aided Diagnosis (CAD) system designed for the automatic classification of retinal images into five distinct classes: Normal, Mild, Moderate, Severe, and Proliferative Diabetic Retinopathy (PDR). The proposed system leverages Convolutional Neural Networks (CNNs) employing pre-trained deep learning models. Through the application of fine-tuning techniques, our model is trained on fundus images of diabetic retinopathy with resolutions of 350x350x3 and 224x224x3. Experimental results obtained on the Kaggle platform, utilizing resources comprising 4 CPUs, 17 GB RAM, and 1 GB Disk, demonstrate the efficacy of our approach. The achieved Area Under the Curve (AUC) values for CNN, MobileNet, VGG-16, InceptionV3, and InceptionResNetV2 models are 0.50, 0.70, 0.53, 0.63, and 0.69, respectively.
研究动机与目标
- 开发一种自动化、准确且可扩展的糖尿病性视网膜病变(DR)计算机辅助诊断(CAD)系统,基于深度学习。
- 评估多种预训练卷积神经网络架构(VGG-16、MobileNet、InceptionV3 和 InceptionResNetV2)在多类别DR分类任务中的性能。
- 通过在有限的眼底图像数据集上对预训练模型进行数据增强和微调,提高分类准确率。
- 识别在医学视网膜图像中检测DR严重程度细微差异的最有效深度学习架构。
- 为未来部署基于轻量级模型(如MobileNet)的移动诊断工具以实现早期DR检测提供支持。
提出的方法
- 在Kaggle提供的1,000张眼底图像数据集上,对预训练深度学习模型(VGG-16、MobileNet、InceptionV3、InceptionResNetV2)进行微调,采用迁移学习方法。
- 应用图像增强技术以增加训练数据的多样性并减少过拟合,将数据集扩展至2,000张图像。
- 将图像调整为350x350x3和224x224x3两种分辨率,以匹配模型输入要求并保留关键视网膜特征。
- 使用Adam优化器并结合早停策略,以改善收敛性并防止训练过程中的过拟合。
- 采用两阶段分类头设计:先通过1x1卷积层,再接两个带有dropout(0.5)的全连接块以实现正则化。
- 冻结浅层参数,仅对高层网络进行微调,以使预训练特征更好地适应医学影像领域。

实验结果
研究问题
- RQ1在有限的眼底图像数据集上,哪种预训练深度学习模型在多类别糖尿病性视网膜病变分类任务中表现最佳?
- RQ2数据增强如何影响迁移学习模型在DR分类任务中的泛化能力和AUC表现?
- RQ3模型深度与架构设计(如Inception与VGG对比)在医学图像分类任务中对AUC和准确率有何影响?
- RQ4经过微调的轻量级模型(如MobileNet)在DR检测任务中能否实现与深层模型(如InceptionResNetV2)相当的性能?
- RQ5不同图像分辨率(224x224与350x350)如何影响模型性能和训练效率?
主要发现
- InceptionResNetV2在AUC上达到最高值0.69,优于VGG-16(0.53)、InceptionV3(0.63)、MobileNet(0.70)以及自建CNN(0.50)。
- MobileNet的AUC为0.70,位居第二,得益于其深度可分离卷积结构和高效架构,尽管参数量更少。
- InceptionV3在训练43个周期后AUC达到0.63,显示出相较于以往研究中使用相同模型的性能提升。
- 尽管训练了85个周期,VGG-16表现欠佳(AUC为0.53),可能因其深度较浅(23层)且缺乏细粒度特征学习能力。
- 自建CNN模型的AUC最低(0.50),表明其性能较差,原因在于网络深度不足且训练数据有限。
- 图像增强与微调显著提升了模型泛化能力,最终训练集通过增强技术扩展至1,620张图像。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。