Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Transformers for fMRI representation

Itzik Malkiel, Gony Rosenman|arXiv (Cornell University)|Dec 10, 2021
Functional Brain Connectivity Studies被引用 10
一句话总结

本文提出TFF,一种用于端到端fMRI表征学习的自监督Transformer框架,该框架在无标签的4D fMRI数据上进行预训练,以重建3D体积,随后在下游任务上进行微调。TFF在无需脑区分割的情况下,实现了年龄和性别预测以及精神分裂症分类的最先进性能,显著优于基线方法,归因于其有效的两阶段预训练与微调策略,结合多损失重建机制。

ABSTRACT

We present TFF, which is a Transformer framework for the analysis of functional Magnetic Resonance Imaging (fMRI) data. TFF employs a two-phase training approach. First, self-supervised training is applied to a collection of fMRI scans, where the model is trained to reconstruct 3D volume data. Second, the pre-trained model is fine-tuned on specific tasks, utilizing ground truth labels. Our results show state-of-the-art performance on a variety of fMRI tasks, including age and gender prediction, as well as schizophrenia recognition. Our code for the training, network architecture, and results is attached as supplementary material.

研究动机与目标

  • 开发一种深度学习框架,通过自监督预训练实现fMRI任务的迁移学习。
  • 解决高维、噪声大的fMRI数据在标注样本有限且标签存在噪声情况下的挑战。
  • 通过端到端处理完整的4D fMRI体积,消除对脑区分割的依赖。
  • 提升在临床fMRI任务(如年龄预测、性别分类和精神分裂症诊断)中的性能。
  • 验证预训练的重要性,并对模型架构的关键组件进行消融分析。

提出的方法

  • TFF采用两阶段训练策略:首先在原始fMRI体积上进行自监督预训练,以重建3D数据,随后在有标签的下游任务上进行微调。
  • 模型将3D fMRI体积视为体素序列,使用可学习的嵌入层将体素转换为标记表示。
  • 多层Transformer编码器处理嵌入体素序列,捕捉4D fMRI扫描中跨空间和时间的长程依赖关系。
  • 预训练采用多损失目标,结合L1、L2和感知损失,从解码输出重建原始fMRI体积。
  • 编码器通过体素级归一化和全局归一化进行初始化,以稳定训练并提升收敛性。
  • 在微调阶段,预训练的编码器分别处理每个fMRI帧,将输出与[CLS]标记拼接,并将序列输入Transformer进行分类。

实验结果

研究问题

  • RQ1自监督预训练过程是否能提升fMRI数据在下游任务中的表征学习能力?
  • RQ2在完整4D fMRI体积上进行端到端训练,与基于分割的方法相比,在性能和泛化能力方面有何差异?
  • RQ3多损失重建目标中各项损失(L1、L2、感知损失)对模型性能和收敛性的贡献如何?
  • RQ4预训练是否能显著提升小样本、噪声较大的fMRI数据集上的性能,特别是对病理分类任务?
  • RQ5两步预训练策略与端到端训练完整模型的一体化训练策略相比,表现如何?

主要发现

  • TFF在年龄和性别预测任务中达到最先进性能,优于现有方法(包括ST-GCN和DeepfMRI)。
  • 在COBRE精神分裂症数据集上,TFF的AUC达到87.9,较ST-GCN提升4个百分点,较DeepfMRI提升8.3个百分点。
  • 与TFF_vanilla基线相比,TFF将NMSE降低约26%,L1损失绝对提升0.4,L2损失绝对提升3.2。
  • TFF_vanilla模型(跳过预训练)在精神分裂症分类任务中无法收敛,凸显了预训练的必要性。
  • 消融研究显示,L1、L2和感知损失以及体素级归一化均对模型收敛性和性能至关重要。
  • 在训练数据减少的情况下,TFF在所有数据规模下均保持优越性能,展现出强大的鲁棒性和泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。