[论文解读] Enhanced Optic Disk and Cup Segmentation with Glaucoma Screening from Fundus Images using Position encoded CNNs
该论文提出了一种基于眼底图像的青光眼筛查集成深度学习框架,结合了位置编码的卷积神经网络(CNN)进行视盘和视杯分割,随后使用预训练的DenseNet201和ResNet18进行分类。该方法在REFUGE验证集上实现了视盘Dice分数0.88和视杯Dice分数0.64,AUC为0.85,通过引入空间坐标信息和多参数CLAHE,显著提升了定位精度与泛化能力。
In this manuscript, we present a robust method for glaucoma screening from fundus images using an ensemble of convolutional neural networks (CNNs). The pipeline comprises of first segmenting the optic disk and optic cup from the fundus image, then extracting a patch centered around the optic disk and subsequently feeding to the classification network to differentiate the image as diseased or healthy. In the segmentation network, apart from the image, we make use of spatial co-ordinate (X \& Y) space so as to learn the structure of interest better. The classification network is composed of a DenseNet201 and a ResNet18 which were pre-trained on a large cohort of natural images. On the REFUGE validation data (n=400), the segmentation network achieved a dice score of 0.88 and 0.64 for optic disc and optic cup respectively. For the tasking differentiating images affected with glaucoma from healthy images, the area under the ROC curve was observed to be 0.85.
研究动机与目标
- 通过将视盘和视杯分割与后续分类相结合,利用深度学习提升青光眼筛查的准确性。
- 通过将空间坐标信息(X, Y)作为额外输入通道,提升分割任务中的结构定位能力。
- 通过采用预训练模型(DenseNet201和ResNet18)的集成方法,降低方差并提升鲁棒性。
- 通过加权交叉熵损失和多参数CLAHE增强技术,缓解不同数据集之间的类别不平衡与域偏移问题。
- 评估空间编码与多尺度直方图均衡化对分割与分类性能的影响。
提出的方法
- 分割网络采用57层全连接的卷积神经网络,包含长距离与短距离跳跃连接,基于加入空间坐标图(X, Y)的眼底图像进行训练,以提升结构定位能力。
- 采用两个分割模型的集成:一个输入为原始RGB图像与坐标图(共5个通道),另一个输入为添加了两幅CLAHE增强图像的版本(共11个通道),以提升对光照变化的鲁棒性。
- 分类流程从分割输出中提取以视盘为中心的550×550图像块,并将其输入到预训练的DenseNet201与ResNet18模型的集成网络中。
- 分类网络的输入包含原始图像以及六种不同配置的CLAHE增强图像变体(使用不同的块大小与截断极限),形成21通道输入,以提升特征多样性。
- 训练过程中使用带类别平衡权重的加权交叉熵损失,以缓解青光眼与健康病例之间的类别不平衡问题。
- 推理阶段,从图像块中提取十个500×500的裁剪区域,最终青光眼概率通过集成模型预测结果的平均值计算得出。
实验结果
研究问题
- RQ1在CNN输入中引入空间坐标信息(X, Y)是否能提升眼底图像中视盘与视杯分割的准确性?
- RQ2使用预训练模型(DenseNet201与ResNet18)的集成是否能优于单模型分类,在分割后的视盘图像块上实现青光眼检测?
- RQ3多参数CLAHE增强技术如何影响模型在光照与对比度多样的眼底图像数据集之间的泛化能力?
- RQ4与使用全部模型相比,对集成模型进行选择性剪枝在性能提升方面有多大程度的改善?
- RQ5使用空间坐标与多尺度CLAHE是否能增强网络对临床相关区域(如视杯与视盘)的关注能力?
主要发现
- 在REFUGE离线验证集(n=400)上,分割网络对视盘的Dice分数达到0.88,对视杯的Dice分数为0.64,表明具有出色的结构定位能力。
- 分类网络在相同验证集上的受试者工作特征曲线下面积(AUC)为0.856,在特异性为0.85时灵敏度达到0.75。
- 在输入层引入空间坐标图显著改善了视盘与视杯的定位效果,激活图分析证实网络注意力集中于这些区域。
- 使用六种不同配置的多参数CLAHE(相比单一CLAHE设置)显著提升了模型在不同数据集间的泛化能力。
- 集成学习有效降低了预测方差并提升了性能,选择性剪枝后的集成模型相比使用全部模型获得了更高的准确率。
- 第一卷积层的激活图证实,网络学习到了对视杯、视盘及背景的关注,与临床相关性一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。