[论文解读] Self-Supervised Transformers for fMRI representation
本文提出TFF,一种用于端到端fMRI表征学习的自监督Transformer框架,该框架在无标签的4D fMRI数据上进行预训练,以重建3D体积,随后在下游任务上进行微调。TFF在无需脑区分割的情况下,实现了年龄和性别预测以及精神分裂症分类的最先进性能,显著优于基线方法,归因于其有效的两阶段预训练与微调策略,结合多损失重建机制。
We present TFF, which is a Transformer framework for the analysis of functional Magnetic Resonance Imaging (fMRI) data. TFF employs a two-phase training approach. First, self-supervised training is applied to a collection of fMRI scans, where the model is trained to reconstruct 3D volume data. Second, the pre-trained model is fine-tuned on specific tasks, utilizing ground truth labels. Our results show state-of-the-art performance on a variety of fMRI tasks, including age and gender prediction, as well as schizophrenia recognition. Our code for the training, network architecture, and results is attached as supplementary material.
研究动机与目标
- 开发一种深度学习框架,通过自监督预训练实现fMRI任务的迁移学习。
- 解决高维、噪声大的fMRI数据在标注样本有限且标签存在噪声情况下的挑战。
- 通过端到端处理完整的4D fMRI体积,消除对脑区分割的依赖。
- 提升在临床fMRI任务(如年龄预测、性别分类和精神分裂症诊断)中的性能。
- 验证预训练的重要性,并对模型架构的关键组件进行消融分析。
提出的方法
- TFF采用两阶段训练策略:首先在原始fMRI体积上进行自监督预训练,以重建3D数据,随后在有标签的下游任务上进行微调。
- 模型将3D fMRI体积视为体素序列,使用可学习的嵌入层将体素转换为标记表示。
- 多层Transformer编码器处理嵌入体素序列,捕捉4D fMRI扫描中跨空间和时间的长程依赖关系。
- 预训练采用多损失目标,结合L1、L2和感知损失,从解码输出重建原始fMRI体积。
- 编码器通过体素级归一化和全局归一化进行初始化,以稳定训练并提升收敛性。
- 在微调阶段,预训练的编码器分别处理每个fMRI帧,将输出与[CLS]标记拼接,并将序列输入Transformer进行分类。
实验结果
研究问题
- RQ1自监督预训练过程是否能提升fMRI数据在下游任务中的表征学习能力?
- RQ2在完整4D fMRI体积上进行端到端训练,与基于分割的方法相比,在性能和泛化能力方面有何差异?
- RQ3多损失重建目标中各项损失(L1、L2、感知损失)对模型性能和收敛性的贡献如何?
- RQ4预训练是否能显著提升小样本、噪声较大的fMRI数据集上的性能,特别是对病理分类任务?
- RQ5两步预训练策略与端到端训练完整模型的一体化训练策略相比,表现如何?
主要发现
- TFF在年龄和性别预测任务中达到最先进性能,优于现有方法(包括ST-GCN和DeepfMRI)。
- 在COBRE精神分裂症数据集上,TFF的AUC达到87.9,较ST-GCN提升4个百分点,较DeepfMRI提升8.3个百分点。
- 与TFF_vanilla基线相比,TFF将NMSE降低约26%,L1损失绝对提升0.4,L2损失绝对提升3.2。
- TFF_vanilla模型(跳过预训练)在精神分裂症分类任务中无法收敛,凸显了预训练的必要性。
- 消融研究显示,L1、L2和感知损失以及体素级归一化均对模型收敛性和性能至关重要。
- 在训练数据减少的情况下,TFF在所有数据规模下均保持优越性能,展现出强大的鲁棒性和泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。