[论文解读] Multimodal Information Fusion for Glaucoma and DR Classification
本文提出了一种用于视网膜疾病分类的新型分层融合方法,结合2D眼底照相、3D OCT和OCT血管造影数据,以提升青光眼和糖尿病视网膜病变的诊断效果。该方法通过在多个网络维度上建模跨模态相关性,优于早期融合和中间融合,在GAMMA数据集上达到0.8996的Kappa值,在PlexEliteDR数据集上达到0.911的AUC值。
Multimodal information is frequently available in medical tasks. By combining information from multiple sources, clinicians are able to make more accurate judgments. In recent years, multiple imaging techniques have been used in clinical practice for retinal analysis: 2D fundus photographs, 3D optical coherence tomography (OCT) and 3D OCT angiography, etc. Our paper investigates three multimodal information fusion strategies based on deep learning to solve retinal analysis tasks: early fusion, intermediate fusion, and hierarchical fusion. The commonly used early and intermediate fusions are simple but do not fully exploit the complementary information between modalities. We developed a hierarchical fusion approach that focuses on combining features across multiple dimensions of the network, as well as exploring the correlation between modalities. These approaches were applied to glaucoma and diabetic retinopathy classification, using the public GAMMA dataset (fundus photographs and OCT) and a private dataset of PlexElite 9000 (Carl Zeis Meditec Inc.) OCT angiography acquisitions, respectively. Our hierarchical fusion method performed the best in both cases and paved the way for better clinical diagnosis.
研究动机与目标
- 通过利用多模态成像数据,解决单模态视网膜疾病分类的局限性。
- 通过融合眼底照相、OCT和OCT血管造影的互补信息,提升青光眼和糖尿病视网膜病变的诊断准确性。
- 通过在多个网络维度上建模跨模态相关性,开发一种优于早期或中间融合的更有效的融合策略。
- 在公开(GAMMA)和私有(PlexEliteDR)数据集上验证所提出的分层融合方法,以确保其临床适用性。
提出的方法
- 开发一种分层融合框架,将深度神经网络多个维度的特征进行融合,实现模态特异性和跨模态表征的联合学习。
- 应用3D卷积神经网络从3D OCT体积中提取空间特征,并使用2D/3D CNN处理眼底图像和OCT血管造影数据。
- 在后期阶段对模态特异性特征进行拼接,并结合注意力机制以突出信息丰富的跨模态相关性。
- 在GAMMA数据集上通过集成ResNet50和ResNet101模型进行最终预测,以提升性能。
- 采用数据增强和迁移学习,使用ImageNet预训练的主干网络(ResNet、DenseNet)以改善泛化能力。
- 通过批量归一化和学习率调度优化训练过程,根据硬件限制调整批量大小(例如,ResNet152的批量大小减小)。
实验结果
研究问题
- RQ1分层融合在多模态视网膜疾病分类中是否优于早期融合和中间融合?
- RQ2眼底图像与OCT图像之间的空间错位如何影响融合性能?分层融合能否缓解此问题?
- RQ3OCT血管造影数据的引入是否能提升分类性能,超越结构化OCT和眼底图像?
- RQ4不同主干网络架构(ResNet、DenseNet)如何影响分层融合的性能?
- RQ5分层融合能否在模态对齐程度不同的数据集中实现泛化?
主要发现
- 在GAMMA数据集上,分层融合方法取得了0.8996的Kappa值,显著优于中间融合(Kappa 0.7340)和单模态方法(Kappa 0.6382)。
- 在PlexEliteDR数据集上,分层融合使用DenseNet121达到了0.911的AUC,优于单模态基线(AUC 0.859)和早期融合(AUC 0.865)。
- 在GAMMA数据集上,中间融合表现不佳,原因是眼底图像与OCT图像之间存在空间错位,凸显了在缺乏对齐的情况下,仅靠特征级融合的局限性。
- 在PlexEliteDR数据集上,早期融合表现良好,因为各模态在空间上对齐,表明空间对齐对输入级融合至关重要。
- 分层融合模型展现出强大的泛化能力,在多种主干网络和数据集上均达到最高性能。
- 在分层框架中集成ResNet50和ResNet101模型,进一步将GAMMA数据集的Kappa值提升至0.8996,表明模型多样性具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。