[论文解读] Longformer: Longitudinal Transformer for Alzheimer's Disease Classification with Structural MRIs
本文提出 LongFormer,一种结合 3D CNN 与 Transformer 的混合模型,利用纵向结构磁共振成像(MRI)和预计算的光流,以提升阿尔茨海默病(AD)分类性能。通过融合图像-光流对中的空间与时间特征,LongFormer 在 ADNI 数据集上实现超过 93% 的准确率,展现出对细微、渐进性脑萎缩模式的优越泛化能力。
Structural magnetic resonance imaging (sMRI) is widely used for brain neurological disease diagnosis; while longitudinal MRIs are often collected to monitor and capture disease progression, as clinically used in diagnosing Alzheimer's disease (AD). However, most current methods neglect AD's progressive nature and only take a single sMRI for recognizing AD. In this paper, we consider the problem of leveraging the longitudinal MRIs of a subject for AD identification. To capture longitudinal changes in sMRIs, we propose a novel model Longformer, a spatiotemporal transformer network that performs attention mechanisms spatially on sMRIs at each time point and integrates brain region features over time to obtain longitudinal embeddings for classification. Our Longformer achieves state-of-the-art performance on two binary classification tasks of separating different stages of AD using the ADNI dataset. Our source code is available at https://github.com/Qybc/LongFormer.
研究动机与目标
- 解决现有方法依赖单时间点(横断面)MRI 扫描进行 AD 分类的局限性,忽略脑萎缩的渐进性特征。
- 开发一种深度学习框架,即使面临缺失数据、数据集规模有限及细微解剖变化等挑战,也能有效从纵向 3D MRI 序列中学习。
- 通过混合 CNN-Transformer 架构,整合 3D MRI 的空间特征与通过预计算光流捕获的时间变化特征。
- 通过利用所有可用的图像-光流对(即使数据不完整或时间间隔稀疏),提升分类性能。
- 在多个公开数据集上,基于纵向结构 MRI 数据,建立二分类 AD 与 NC 的新最先进基准。
提出的方法
- 模型采用 3D CNN 主干网络(DenseNet121)从 3D 结构 MRI 体积中提取空间嵌入,降低输入维度以供后续处理。
- 通过预计算的光流捕捉当前扫描与先前扫描之间的纵向变化,经归一化后作为互补输入模态。
- 采用基于查询的 Transformer 模型,结合可变形交叉注意力机制,动态关注 MRI 及其对应光流中的空间与时间特征。
- 使用可学习查询聚合全局上下文信息,使模型能够聚焦于分类任务中具有判别性的时空模式。
- 端到端在图像-光流对上进行训练,即使部分时间点缺失,也能充分利用纵向数据。
- 使用预计算光流可减轻网络直接学习微小时间变化的负担,提升训练稳定性与性能。
实验结果
研究问题
- RQ1基于视觉 Transformer 的模型能否有效从 3D 纵向 MRI 中学习,以超越单时间点 MRI 分析的 AD 分类性能?
- RQ2与直接从图像序列学习相比,将预计算光流作为纵向变化的代理是否能提升模型性能?
- RQ33D CNN 主干网络的选择如何影响混合 CNN-Transformer 架构在 AD 分类中的性能表现?
- RQ4在 Transformer 解码器中,最优的可学习查询数量是多少,以在模型容量与分类准确率之间取得平衡?
- RQ5所提出方法能否在数据完整性与受试者人口统计特征各异的多个公共数据集(ADNI、OASIS、AIBL)上实现良好泛化?
主要发现
- LongFormer 在全部三个基准数据集上均达到最先进性能,在 ADNI 数据集上准确率超过 93%,显著优于八种基线方法。
- 使用预计算光流的模型性能优于直接从图像序列学习的模型,证明了分离空间与时间特征学习的有效性。
- 在测试的 CNN 主干网络中,DenseNet121 提供最佳图像嵌入效果,且在所有主干网络上添加 Transformer 模块均进一步提升了准确率。
- Transformer 解码器中可学习查询的最优数量为 125 个,该设置在所有数据集上均取得最高分类准确率。
- 消融实验证实,纵向信息(尤其是与光流结合时)对区分 AD 与 NC 受试者至关重要,尤其在单时间点扫描存在歧义时。
- 模型通过利用所有可用的图像-光流对,有效处理缺失数据,无需插补或数据过滤即可增加有效训练样本量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。