Skip to main content
QUICK REVIEW

[论文解读] SSiT: Saliency-guided Self-supervised Image Transformer for Diabetic Retinopathy Grading

Yijin Huang, Junyan Lyu|arXiv (Cornell University)|Oct 20, 2022
Retinal Imaging and Analysis被引用 8
一句话总结

该论文提出SSiT,一种用于糖尿病视网膜病变(DR)分级的显著性引导自监督视觉Transformer模型,通过将眼底图像显著性图整合到对比学习和显著性预测中,增强表征学习。通过利用显著性图过滤关键编码器中的无意义图像块,并训练查询编码器以预测显著性分割,SSiT增强了对疾病相关区域的关注,从而在多个DR数据集上实现最先进性能,展现出优越的泛化能力和细粒度特征保留。

ABSTRACT

Self-supervised Learning (SSL) has been widely applied to learn image representations through exploiting unlabeled images. However, it has not been fully explored in the medical image analysis field. In this work, Saliency-guided Self-Supervised image Transformer (SSiT) is proposed for Diabetic Retinopathy (DR) grading from fundus images. We novelly introduce saliency maps into SSL, with a goal of guiding self-supervised pre-training with domain-specific prior knowledge. Specifically, two saliency-guided learning tasks are employed in SSiT: (1) Saliency-guided contrastive learning is conducted based on the momentum contrast, wherein fundus images' saliency maps are utilized to remove trivial patches from the input sequences of the momentum-updated key encoder. Thus, the key encoder is constrained to provide target representations focusing on salient regions, guiding the query encoder to capture salient features. (2) The query encoder is trained to predict the saliency segmentation, encouraging the preservation of fine-grained information in the learned representations. To assess our proposed method, four publicly-accessible fundus image datasets are adopted. One dataset is employed for pre-training, while the three others are used to evaluate the pre-trained models' performance on downstream DR grading. The proposed SSiT significantly outperforms other representative state-of-the-art SSL methods on all downstream datasets and under various evaluation settings. For example, SSiT achieves a Kappa score of 81.88% on the DDR dataset under fine-tuning evaluation, outperforming all other ViT-based SSL methods by at least 9.48%.

研究动机与目标

  • 为解决自监督学习(SSL)在医学图像分析中因自然图像与医学图像之间存在领域差距而导致的有效性有限的问题。
  • 通过引入领域特定先验知识——特别是眼底图像的显著性图,改进糖尿病视网膜病变分级中的表征学习。
  • 通过在动量编码器中过滤非显著性图像块,引导对比学习聚焦于具有诊断意义的区域。
  • 通过端到端的显著性分割预测,保留学习表征中的细粒度病灶级细节。
  • 证明显著性引导的自监督学习能显著提升下游DR分级任务在多个数据集上的性能。

提出的方法

  • 提出一种基于动量对比的显著性引导对比学习框架,其中通过显著性图对关键编码器的输入序列进行过滤,以抑制无意义图像块。
  • 使用预训练的、不可训练的显著性检测方法,从无标注的眼底图像中生成像素级显著性图,无需人工标注。
  • 采用双头Transformer架构,包含一个查询编码器和一个动量更新的关键编码器,用于对比表征学习。
  • 实现多任务头结构,使查询编码器在预训练过程中联合预测输入图像的显著性分割掩码。
  • 应用标准数据增强方法(如裁剪、颜色抖动)生成对比学习的正样本视图。
  • 采用ViT-S和ViT-B主干网络进行预训练,并在下游DR分级任务上通过线性评估和k-NN分类进行微调。

实验结果

研究问题

  • RQ1显著性图能否在医学图像分析中有效引导自监督预训练,特别是在糖尿病视网膜病变任务中?
  • RQ2在关键编码器中过滤非显著性图像块是否能提升学习表征的判别能力?
  • RQ3在预训练过程中端到端进行显著性预测,是否能增强对细粒度病灶级特征的保留?
  • RQ4SSiT在多个数据集上的下游DR分级性能与当前最先进SSL方法相比如何?
  • RQ5显著性引导在多大程度上提升了自监督视觉Transformer在眼底图像分析中的泛化能力与迁移能力?

主要发现

  • 在DDR数据集上,SSiT使用ViT-S主干网络实现了86.3%的加权 Cohen's kappa 分数,优于所有对比的SOTA方法。
  • 在IDRiD数据集上,SSiT在ViT-S主干下线性评估准确率达到94.7%,在ViT-B主干下达到95.2%,超过现有SSL基线方法。
  • 该模型在所有四个基准数据集(DDR、IDRiD、APTOS和KAGGLE)上均表现出一致的性能提升,无论采用微调还是线性评估协议。
  • 显著性引导的对比学习使学习表征更聚焦于DR相关区域,如微动脉瘤和出血灶。
  • 显著性预测头使模型能够保留丰富的语义信息,具备在病灶分割等密集预测任务中的潜在应用价值。
  • SSiT通过利用带有显著性先验的无标注数据,减少了对大规模标注数据的依赖,提升了预训练阶段的样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。