[论文解读] Local Spatiotemporal Representation Learning for Longitudinally-consistent Neuroimage Analysis
该论文提出了一种用于纵向神经影像的局部多尺度时空表征学习框架,通过利用跨时间和空间尺度的受试者内特征自相似性来实现。通过在解码器中引入方差、协方差和正交性正则化,并在微调过程中加入分割一致性损失,该方法在成人和婴儿MRI数据集上相较于自监督和监督基线方法,实现了更优的分割准确率和纵向一致性。
Recent self-supervised advances in medical computer vision exploit the global and local anatomical self-similarity for pretraining prior to downstream tasks such as segmentation. However, current methods assume i.i.d. image acquisition, which is invalid in clinical study designs where follow-up longitudinal scans track subject-specific temporal changes. Further, existing self-supervised methods for medically-relevant image-to-image architectures exploit only spatial or temporal self-similarity and do so via a loss applied only at a single image-scale, with naive multi-scale spatiotemporal extensions collapsing to degenerate solutions. To these ends, this paper makes two contributions: (1) It presents a local and multi-scale spatiotemporal representation learning method for image-to-image architectures trained on longitudinal images. It exploits the spatiotemporal self-similarity of learned multi-scale intra-subject image features for pretraining and develops several feature-wise regularizations that avoid degenerate representations; (2) During finetuning, it proposes a surprisingly simple self-supervised segmentation consistency regularization to exploit intra-subject correlation. Benchmarked across various segmentation tasks, the proposed framework outperforms both well-tuned randomly-initialized baselines and current self-supervised techniques designed for both i.i.d. and longitudinal datasets. These improvements are demonstrated across both longitudinal neurodegenerative adult MRI and developing infant brain MRI and yield both higher performance and longitudinal consistency.
研究动机与目标
- 为解决现有自监督方法假设数据独立同分布(i.i.d.)的局限性,该假设在纵向神经影像中不成立,因为受试者内的时间相关性较强。
- 通过在解码器中引入特征级别的正则化,避免在无负样本情况下多尺度局部对比学习中出现退化表征,从而克服图像到图像网络中的退化问题。
- 通过在微调期间使用简单的自监督一致性正则化,提升在低样本和少样本设置下的分割性能与纵向一致性。
- 从无标签的纵向MRI数据中学习到鲁棒且可迁移的表征,以支持神经退行性和发育性脑研究中的下游分割任务。
提出的方法
- 在编码器和解码器分支中,通过跨多尺度特征的局部时空自相似性,应用基于图像块的余弦相似度损失,以挖掘纵向图像序列中的局部时空自相似性。
- 在解码器特征上引入三种正则化项——去噪、方差和协方差正则化,以及正交性正则化,以防止在缺乏负样本时出现退化解。
- 采用对比学习目标,将受试者内对应图像块位置作为正样本,避免导致位置相关特征的朴素负样本采样。
- 在微调过程中应用自监督一致性正则化,以鼓励在无标签数据上相邻时间点间的一致性分割预测。
- 采用U-Net架构,并在时间点之间共享权重,以确保时间对齐和特征一致性。
- 通过组合多尺度对比损失和正则化项,端到端训练模型,并在有限标注数据上进行微调。
实验结果
研究问题
- RQ1当独立同分布假设不成立时,局部多尺度时空自监督能否提升纵向神经影像中的表征学习?
- RQ2在无负样本的情况下,如何避免多尺度局部对比学习在图像到图像架构中出现的退化表征?
- RQ3在微调过程中强制分割预测的时空一致性,是否能提升性能和纵向一致性?
- RQ4所提方法能否在包括儿科和成人神经退行性人群在内的多样化纵向神经影像任务中实现泛化?
主要发现
- 所提方法在成人和婴儿MRI数据集的一次、少次和全量样本分割任务中,均优于经过充分调优的随机初始化模型及当前最优的自监督方法。
- 引入正则化后,解码器特征表现出更高的空间可变性和更丰富的语义内容,表现为更高秩的空间协方差矩阵和更多样化的相似度图。
- 消融实验中若无正则化,模型收敛至退化表征,空间多样性低且存在伪影,尤其在更深的解码器层中更为明显。
- 在微调过程中引入分割一致性正则化,显著提升了时间点间预测的纵向一致性。
- 可视化结果表明,正则化特征在时间维度上产生语义上有意义的相似性模式,而未正则化的特征则产生空间冗余且含伪影的输出。
- 定量结果表明,完整模型即使在标注数据有限的情况下,仍能取得更高的Dice分数和更优的时间一致性,优于基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。