[论文解读] Pretrained Deep 2.5D Models for Efficient Predictive Modeling from Retinal OCT
该论文提出了一种结合2D卷积神经网络(CNN)与双向长短期记忆网络(BiLSTM)或Transformer架构的预训练2.5D深度学习模型,用于从视网膜OCT扫描中高效预测湿性年龄相关性黄斑变性(AMD)的进展。通过利用领域内自监督预训练方法TINC,该方法在性能上优于ImageNet预训练和更大的3D模型,其中CNN+BiLSTM架构在两个纵向OCT数据集上的AUROC和PRAUC指标上均优于CNN+Transformer。
In the field of medical imaging, 3D deep learning models play a crucial role in building powerful predictive models of disease progression. However, the size of these models presents significant challenges, both in terms of computational resources and data requirements. Moreover, achieving high-quality pretraining of 3D models proves to be even more challenging. To address these issues, hybrid 2.5D approaches provide an effective solution for utilizing 3D volumetric data efficiently using 2D models. Combining 2D and 3D techniques offers a promising avenue for optimizing performance while minimizing memory requirements. In this paper, we explore 2.5D architectures based on a combination of convolutional neural networks (CNNs), long short-term memory (LSTM), and Transformers. In addition, leveraging the benefits of recent non-contrastive pretraining approaches in 2D, we enhanced the performance and data efficiency of 2.5D techniques even further. We demonstrate the effectiveness of architectures and associated pretraining on a task of predicting progression to wet age-related macular degeneration (AMD) within a six-month period on two large longitudinal OCT datasets.
研究动机与目标
- 为解决在从视网膜OCT扫描预测AMD进展时,3D医学影像数据标注样本有限的挑战。
- 开发一种计算效率高且显存占用低的替代方案,以替代用于体积OCT分析的3D深度学习模型。
- 评估不同2.5D架构(特别是CNN+BiLSTM与CNN+Transformer)对预测性能的影响。
- 比较在低资源环境下,领域内自监督预训练(TINC)与ImageNet预训练的有效性。
- 评估模型在存在领域差异的数据集(如PINNACLE)上的泛化性能。
提出的方法
- 采用2.5D架构,即对3D OCT体积中的每个B-scan切片应用2D CNN,随后使用BiLSTM或Transformer对切片级特征进行序列建模以聚合信息。
- 在未标注的领域内OCT数据集上使用一种非对比性自监督预训练方法(TINC)来初始化2D CNN权重,从而提升数据效率。
- 在两个大型纵向OCT数据集(HARBOR和PINNACLE)上微调2.5D模型,进行6个月湿性AMD进展的二分类任务。
- 比较使用ImageNet权重、TINC权重以及ViViT的DukeAMD预训练权重初始化的模型,以评估领域特定预训练的优势。
- 应用平均池化和注意力机制来整合跨切片的特征,其中注意力分数增强了模型的可解释性。
- 以AUROC和PRAUC为主要评估指标,并通过消融实验分析模型大小、浮点运算量(FLOPs)和参数量。

实验结果
研究问题
- RQ1与ImageNet预训练相比,领域内自监督预训练(TINC)是否能提升2.5D模型在低资源3D OCT分类任务中的性能?
- RQ2结合2D CNN与序列模型(BiLSTM或Transformer)的混合2.5D架构是否能在预测AMD进展方面优于完整的3D模型?
- RQ3在数据稀缺和领域偏移条件下,不同2.5D架构(CNN+BiLSTM与CNN+Transformer)在性能、参数效率和鲁棒性方面如何比较?
- RQ4领域偏移(如PINNACLE中的扫描仪差异)在多大程度上影响模型泛化能力?领域内预训练能否缓解此问题?
- RQ5在2.5D Transformer模型中,注意力机制是否对临床预测任务的可解释性和性能具有实际帮助?
主要发现
- 在HARBOR数据集上,使用TINC预训练的CNN+BiLSTM模型在AUROC(0.766±0.012)和PRAUC(0.646±0.019)上均达到最高,优于ImageNet和ViViT基线模型。
- TINC预训练在所有架构和数据集上均持续优于ImageNet预训练,尤其在存在领域偏移的PINNACLE数据集上提升最为显著。
- 尽管参数量仅为34M(相比108M)的1/3,CNN+BiLSTM模型在HARBOR和PINNACLE数据集上的AUROC和PRAUC指标上均优于或等同于更大的CNN+Transformer模型。
- 2.5D模型在所有指标上均优于3D I3D和ViViT FSA模型,表明显式建模切片间关系优于同时处理3D数据的方案。
- 在PINNACLE数据集上,尽管AUROC相比HARBOR有显著下降,TINC预训练仍保持了较强的性能,表明其对领域偏移具有鲁棒性。
- CNN+Transformer模型中的注意力机制提供了可解释的注意力分数,但并未带来优于更简单BiLSTM架构的性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。