[论文解读] Zoom-in-Net: Deep Mining Lesions for Diabetic Retinopathy Detection
Zoom-in-Net 是一种弱监督深度学习框架,通过模仿临床医生的放大观察行为,仅使用图像级别标签即可检测糖尿病性视网膜病变。该方法生成注意力图以定位病灶,并通过联合分析整体图像与高分辨率可疑区域,提升分类性能,在 EyePACS 和 Messidor 数据集上分别实现了 0.857 AUC 和 0.957 AUC 的最先进性能。
We propose a convolution neural network based algorithm for simultaneously diagnosing diabetic retinopathy and highlighting suspicious regions. Our contributions are two folds: 1) a network termed Zoom-in-Net which mimics the zoom-in process of a clinician to examine the retinal images. Trained with only image-level supervisions, Zoomin-Net can generate attention maps which highlight suspicious regions, and predicts the disease level accurately based on both the whole image and its high resolution suspicious patches. 2) Only four bounding boxes generated from the automatically learned attention maps are enough to cover 80% of the lesions labeled by an experienced ophthalmologist, which shows good localization ability of the attention maps. By clustering features at high response locations on the attention maps, we discover meaningful clusters which contain potential lesions in diabetic retinopathy. Experiments show that our algorithm outperform the state-of-the-art methods on two datasets, EyePACS and Messidor.
研究动机与目标
- 开发一种弱监督深度学习框架,实现在无需病灶级别标注的情况下,同时完成糖尿病性视网膜病变的分类与定位。
- 通过设计一种网络结构,识别高注意力区域并在更高分辨率下处理,以模仿临床医生扫描并放大可疑区域的工作流程。
- 通过对比注意力图与临床医生标注的病灶覆盖范围,验证注意力图的定位能力。
- 通过融合来自整体图像和从注意力图中提取的高分辨率区域的预测结果,提升分类性能。
- 通过分析注意力图中高响应位置的特征,发现有意义的病灶聚类。
提出的方法
- Zoom-in-Net 由三个子网络组成:M-Net 负责整体图像分类,A-Net 负责从特征图生成门控注意力图,C-Net 负责对从高注意力区域裁剪出的高分辨率区域进行分类。
- A-Net 采用双分支结构:一个分支通过全局平均池化生成类别激活图,另一个分支学习空间门控,利用可学习的 Sigmoid 函数优化注意力图。
- 网络采用端到端训练,损失函数由交叉熵损失(用于 M-Net 和 C-Net)与基于预测注意力图与真实病灶区域重叠程度的定位损失共同构成。
- 从原始 1230×1230 图像中,基于注意力图的前 4 个高注意力位置(设为 200×200 区域大小)裁剪出高分辨率区域(384×384),并输入 C-Net 进行局部分类。
- 最终预测结果为 M-Net 与 C-Net 输出的加权融合,其中注意力图用于引导区域选择,提升模型可解释性。
- 对注意力图中高激活区域的特征进行聚类,发现具有临床意义的病灶样模式,表明该方法能够识别出具有生物学意义的结构。
实验结果
研究问题
- RQ1仅使用图像级别标签进行训练的深度学习模型,能否以高召回率和高准确率定位糖尿病性视网膜图像中的可疑区域?
- RQ2将注意力引导区域提取的高分辨率区域整合到分类中,是否能超越仅基于整体图像分析的糖尿病性视网膜病变分类性能?
- RQ3模型生成的注意力图与临床医生标注的病灶在多大程度上一致?
- RQ4对注意力图中高响应区域的特征进行聚类,能否揭示糖尿病性视网膜病变中具有生物学意义的病灶模式?
- RQ5与当前最先进方法相比,所提出的 Zoom-in-Net 框架在诊断性能与定位能力方面表现如何?
主要发现
- 在 EyePACS 数据集的验证集上,Zoom-in-Net 的 AUC 达到 0.857,在测试集上为 0.849,优于使用单一模型的最先进方法(如 Min-pooling:0.86/0.849)。
- 通过模型集成,Zoom-in-Net 在验证集上达到 AUC 0.865,在测试集上达到 0.854,与 Kaggle DR 竞赛中排名第一的模型性能相当。
- 在 Messidor 数据集中,Zoom-in-Net 在可转诊与不可转诊分类任务中 AUC 达到 0.957,在正常与异常分类中达到 0.921,优于所有先前方法,甚至在某些情况下达到专家水平性能。
- 注意力图仅用四个边界框即定位了 80% 临床医生标注的病灶,召回率达到 0.82,展现出强大的定位能力。
- 对注意力图中高响应位置的特征进行聚类,揭示了有意义的病灶样模式,表明模型能够学习检测具有生物学意义的结构。
- 模型性能与普通医生相当,甚至在某些场景下(如在低特异性阈值下,例如可转诊 DR 的敏感度为 0.978,特异性为 0.5)优于部分专家级基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。