[论文解读] Inference of visual field test performance from OCT volumes using deep learning
本研究提出一种三维卷积神经网络(CNN),直接从视神经乳头(ONH)或黄斑区的原始光学相干断层扫描(OCT)体积中推断视野检查(VFT)指标——视野指数(VFI)和平均偏差(MD),无需进行分割或配准。该CNN在ONH扫描上对VFI的皮尔逊相关系数为0.88 ± 0.035,对MD的皮尔逊相关系数为0.88 ± 0.023,显著优于随机森林等经典机器学习模型(PC = 0.74 ± 0.090)。
Visual field tests (VFT) are pivotal for glaucoma diagnosis and conducted regularly to monitor disease progression. Here we address the question to what degree aggregate VFT measurements such as Visual Field Index (VFI) and Mean Deviation (MD) can be inferred from Optical Coherence Tomography (OCT) scans of the Optic Nerve Head (ONH) or the macula. Accurate inference of VFT measurements from OCT could reduce examination time and cost. We propose a novel 3D Convolutional Neural Network (CNN) for this task and compare its accuracy with classical machine learning (ML) algorithms trained on common, segmentation-based OCT, features employed for glaucoma diagnostics. Peak accuracies were achieved on ONH scans when inferring VFI with a Pearson Correlation (PC) of 0.88$\\pm$0.035 for the CNN and a significantly lower (p $<$ 0.01) PC of 0.74$\\pm$0.090 for the best performing, classical ML algorithm - a Random Forest regressor. Estimation of MD was equally accurate with a PC of 0.88$\\pm$0.023 on ONH scans for the CNN.
研究动机与目标
- 探究是否能够无需分割或配准,直接从原始OCT体积中准确推断视野检查(VFT)的综合指标(如VFI和MD)。
- 比较3D CNN与基于标准分割特征训练的经典机器学习模型的性能表现。
- 评估在青光眼诊断与疾病进展监测中,是否可替代或减少对视野检查的依赖。
- 利用类别激活图(CAMs)评估深度学习模型的可解释性,识别对预测具有贡献的关键视网膜区域。
- 确定模型性能是否受限于VFT测量的固有变异性,或OCT数据本身的结构局限性。
提出的方法
- 在视神经乳头(ONH)或黄斑区的原始、下采样OCT体积(64×64×128)上端到端训练3D卷积神经网络(CNN),无需预先分割。
- 网络通过均方误差损失函数预测VFI和MD,数据按80%训练集、10%验证集和10%测试集划分,确保患者层面的数据完整性。
- 性能通过均方根误差(RMSE)和皮尔逊相关系数(PC)评估,PC计算为预测值与真实值之间的标准相关系数。
- 生成类别激活图(CAMs)以可视化OCT体积中对预测贡献最大的区域,提升模型可解释性。
- 探索了包括随机遮挡、平移、小角度旋转(±10°)和Mixup在内的数据增强技术,但因未显著提升准确率,未用于最终结果。
- 模型未将年龄或眼内压(IOP)作为输入,仅依赖原始OCT强度体积进行预测。
实验结果
研究问题
- RQ1是否能够无需分割或配准,直接从原始OCT体积中准确推断VFI和MD等综合VFT指标?
- RQ2与基于标准分割特征训练的经典机器学习模型(如随机森林、SVM)相比,3D CNN的性能如何?
- RQ3类别激活图(CAMs)在多大程度上揭示了与视野缺损相关的生物上合理的OCT体积区域?
- RQ4深度学习模型的性能是否受限于视野检查的固有变异性,或OCT成像中的结构伪影?
- RQ5与先前方法相比,该模型因未显式进行分割和配准,在中度至重度青光眼病例中是否表现出更强的鲁棒性?
主要发现
- 在使用ONH扫描时,3D CNN对VFI的皮尔逊相关系数(PC)为0.88 ± 0.035,对MD的PC为0.88 ± 0.023,显著优于最佳经典模型(随机森林)的PC值0.74 ± 0.090(p < 0.01)。
- 该CNN在完整数据集上的表现达到VFI的PC为0.93,表明泛化能力极强;尽管测试集的PC为0.88,仍保持高水平且稳定。
- 类别激活图(CAMs)显示,网络在健康眼中主要关注GCIPL(神经节细胞层与内丛状层),在晚期青光眼(VFI = 50, 30)中则逐步聚焦于特定变薄区域。
- 模型性能接近VFT可靠性的上限,因已有研究报道VFT重测变异性相关系数为r = 0.88,表明该CNN可能已逼近推断准确性的实际极限。
- 使用未经分割或配准的原始OCT体积可避免多视野OCT配准和层分割中常见的错误,尤其在晚期青光眼中优势明显。
- 尽管尝试了数据增强(遮挡、旋转、Mixup),但未观察到准确率显著提升,表明模型可能已接近当前数据分布下的最优性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。