[论文解读] Unsupervised deep learning for grading of age-related macular degeneration using retinal fundus images
本文提出了一种无监督深度学习方法,利用非参数实例判别(NPID)从视网膜眼底图像中无须标注数据即可分级年龄相关性黄斑变性(AMD)的严重程度。该方法在高级或需转诊的AMD分级上达到与有监督网络及人类眼科医生相当的准确率,同时在无须人工定义标签的情况下,发现了与疾病相关的特征,如地图样萎缩和白内障。
Many diseases are classified based on human-defined rubrics that are prone to bias. Supervised neural networks can automate the grading of retinal fundus images, but require labor-intensive annotations and are restricted to the specific trained task. Here, we employed an unsupervised network with Non-Parametric Instance Discrimination (NPID) to grade age-related macular degeneration (AMD) severity using fundus photographs from the Age-Related Eye Disease Study (AREDS). Our unsupervised algorithm demonstrated versatility across different AMD classification schemes without retraining, and achieved unbalanced accuracies comparable to supervised networks and human ophthalmologists in classifying advanced or referable AMD, or on the 4-step AMD severity scale. Exploring the networks behavior revealed disease-related fundus features that drove predictions and unveiled the susceptibility of more granular human-defined AMD severity schemes to misclassification by both ophthalmologists and neural networks. Importantly, unsupervised learning enabled unbiased, data-driven discovery of AMD features such as geographic atrophy, as well as other ocular phenotypes of the choroid, vitreous, and lens, such as visually-impairing cataracts, that were not pre-defined by human labels.
研究动机与目标
- 开发一种无需依赖昂贵且耗时的人工标注的视网膜眼底图像AMD严重程度分级方法。
- 解决有监督模型受限于预定义分类方案且易产生偏差的局限性。
- 实现基于数据的AMD相关特征发现,包括临床标准中未预先定义的特征。
- 评估无监督表示学习是否能在AMD分级中达到或超过有监督模型及人类专家的性能。
提出的方法
- 作者采用无监督深度神经网络结合非参数实例判别(NPID),在无标签情况下从视网膜眼底图像中学习有意义的表示。
- NPID通过对比同一图像的不同增强版本,同时将不同图像的特征相互推开,促使网络学习具有判别性的特征。
- 所学习的特征用于在多种分级方案中分类AMD严重程度,包括四步AMD分级标准和需转诊/高级AMD类别。
- 模型在年龄相关性眼病研究(AREDS)数据集上进行评估,通过零样本迁移适应不同分类方案,无需微调或重新训练。
- 通过特征可视化和显著性分析,解释模型的预测结果,并识别视网膜中与疾病相关的模式。
- 该方法通过潜在表示分析,发现了此前未标注的眼部表型,如地图样萎缩、白内障和玻璃体改变。
实验结果
研究问题
- RQ1无监督深度学习模型是否能在AMD严重程度分级上达到与有监督模型及人类眼科医生相当的性能?
- RQ2无监督表示学习是否能实现对临床相关眼部特征的发现,而这些特征在人类分级方案中未预先定义?
- RQ3该模型在无需微调或重新训练的情况下,如何在不同AMD分类方案间实现泛化?
- RQ4人类眼科医生与神经网络在细微或颗粒状AMD严重程度阶段的误分类程度如何?
- RQ5哪些特定的视网膜特征驱动了模型的预测,其与已知疾病病理是否一致?
主要发现
- 无监督NPID模型在分类需转诊或高级AMD时,实现了与有监督深度学习模型及人类眼科医生相当的不平衡准确率。
- 该模型在无需重新训练的情况下,实现了对多种AMD分级方案的零样本泛化,包括四步AMD严重程度分级标准。
- 通过表示学习,模型发现了与疾病相关的特征,如地图样萎缩和白内障,尽管这些特征在训练数据中未被明确标注。
- 显著性分析显示,模型聚焦于临床相关区域,如玻璃疣和色素改变,与专家诊断标志一致。
- 模型与人类专家在颗粒状AMD严重程度分类上的误判率均有所上升,表明这些分类本身存在固有的模糊性。
- 该方法通过潜在特征分析揭示了额外的眼部表型,如晶状体混浊和玻璃体改变,表明其在AMD以外的诊断应用潜力更广。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。