[论文解读] Two-Stream CNN with Loose Pair Training for Multi-modal AMD Categorization
本文提出一种采用松散配对训练的双流卷积神经网络(CNN),用于使用彩色眼底照相和光学相干断层扫描(OCT)图像进行端到端多模态年龄相关性黄斑变性(AMD)分类。通过融合两种模态的特征,并基于标签实现松散配对以增加训练数据,该方法在真实临床数据上实现了97.1%的准确率,显著优于先前的最先进方法,同时通过多模态类激活映射实现了可视化解释。
This paper studies automated categorization of age-related macular degeneration (AMD) given a multi-modal input, which consists of a color fundus image and an optical coherence tomography (OCT) image from a specific eye. Previous work uses a traditional method, comprised of feature extraction and classifier training that cannot be optimized jointly. By contrast, we propose a two-stream convolutional neural network (CNN) that is end-to-end. The CNN's fusion layer is tailored to the need of fusing information from the fundus and OCT streams. For generating more multi-modal training instances, we introduce Loose Pair training, where a fundus image and an OCT image are paired based on class labels rather than eyes. Moreover, for a visual interpretation of how the individual modalities make contributions, we extend the class activation mapping technique to the multi-modal scenario. Experiments on a real-world dataset collected from an outpatient clinic justify the viability of our proposal for multi-modal AMD categorization.
研究动机与目标
- 解决使用眼底照相和OCT图像进行AMD分类时,端到端可训练的多模态深度学习模型缺乏的问题。
- 克服临床多模态数据集中配对训练样本数量有限的问题。
- 在性能上超越单模态和现有多模态基线方法。
- 通过扩展的类激活映射技术,实现对各模态贡献的可视化解释。
- 在真实门诊临床数据集上验证方法,确保其临床相关性。
提出的方法
- 设计一个具有对称分支的双流CNN,分别独立处理眼底照相和OCT图像,随后进行特征融合。
- 引入一种自定义融合层,将两路特征进行结合,以支持端到端训练和可解释性。
- 提出松散配对训练方法,即基于类别标签而非解剖学上的对应眼对来配对眼底照相和OCT图像,以提升训练数据的多样性。
- 将类激活映射(CAM)方法扩展至多模态场景,用于可视化对预测有贡献的图像区域。
- 采用端到端反向传播框架进行模型训练,使用交叉熵损失函数实现三分类(正常、干性AMD、湿性AMD)。
- 在两路中均采用ResNet-18作为主干网络,并在多模态数据集上进行微调。
实验结果
研究问题
- RQ1端到端的双流CNN是否能在多模态AMD分类中优于单模态模型?
- RQ2当配对数据稀缺时,松散配对训练是否能有效增加有用训练样本的数量?
- RQ3所提出的方法是否能超越Yoo等人[16]提出的最先进多模态方法?
- RQ4眼底照相和OCT模态对最终预测的贡献如何?是否可实现可视化解释?
- RQ5融合策略是否能有效结合眼底照相和OCT图像中互补的信息?
主要发现
- 所提出的采用松散配对训练的多模态CNN(MM-CNN-L)整体准确率达到97.1%,显著优于先前最先进方法(82.6%准确率)。
- OCT-CNN单模态模型达到94.2%的F1分数,确立了强有力的基线,多模态模型必须超越该基线。
- MM-CNN-L将干性AMD的F1分数从Yoo等人(-L)的82.8%提升至95.8%,表明对中间阶段AMD的检测能力显著增强。
- 该方法减少了将干性AMD误分类为湿性AMD的情况,这是单模态模型中的常见错误,表明诊断精度得到提升。
- 松散配对训练将基线方法(Yoo等人[16])的整体F1分数从83.5%提升至89.0%,证实了其通用性优势。
- 通过扩展的CAM进行可视化解释表明,眼底照相和OCT均对预测有显著贡献,且在不同模态中表现出不同的注意力模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。