Skip to main content
QUICK REVIEW

[论文解读] Evaluating the Robustness of Self-Supervised Learning in Medical Imaging

Fernando Navarro, Christopher Watanabe|arXiv (Cornell University)|May 14, 2021
COVID-19 diagnosis using AI参考文献 29被引用 17
一句话总结

本文评估了自监督学习(SSL)在医学影像中的鲁棒性与泛化能力,表明尽管在干净数据上的性能提升微乎其微,但SSL模型在肺炎检测和多器官分割任务中,面对模糊、噪声和分辨率变化等图像退化时,仍优于完全监督的神经网络。其主要贡献在于揭示了SSL的真实优势在于鲁棒的特征学习,而不仅仅是干净数据上的准确率。

ABSTRACT

Self-supervision has demonstrated to be an effective learning strategy when training target tasks on small annotated data-sets. While current research focuses on creating novel pretext tasks to learn meaningful and reusable representations for the target task, these efforts obtain marginal performance gains compared to fully-supervised learning. Meanwhile, little attention has been given to study the robustness of networks trained in a self-supervised manner. In this work, we demonstrate that networks trained via self-supervised learning have superior robustness and generalizability compared to fully-supervised learning in the context of medical imaging. Our experiments on pneumonia detection in X-rays and multi-organ segmentation in CT yield consistent results exposing the hidden benefits of self-supervision for learning robust feature representations.

研究动机与目标

  • 探究自监督学习(SSL)在医学影像中是否在干净数据准确率之外具有其他优势。
  • 评估SSL模型在临床影像中常见图像退化下的鲁棒性。
  • 评估SSL特征在部署于未见数据分布(如不同影像中心或扫描协议)时的泛化能力。
  • 确定SSL的优越性能是否被仅关注干净数据的评估指标所掩盖。
  • 探索SSL是否可作为低数据场景下鲁棒且可迁移表征的基础。

提出的方法

  • 使用完全监督和自监督预训练方法,分别在ResNet-18上训练肺炎检测模型,在U-Net上训练多器官分割模型。
  • 应用七种标准图像退化(如高斯模糊、亮度偏移、分辨率变化)以评估在分布偏移下的鲁棒性。
  • 采用JigsawNet作为自监督的预训练任务,通过图像块排列预测迫使网络学习空间关系。
  • 在退化条件下,使用准确率(分类任务)和Dice分数(分割任务)评估性能,并与完全监督基线进行比较。
  • 通过将一个数据集(如LIDC-IDRI)上训练的模型部署到另一个测试集(KITS2019)上,开展领域泛化测试,衡量跨领域性能。
  • 应用统计显著性检验(p < 0.001)以验证各类退化下鲁棒性提升的可靠性。

实验结果

研究问题

  • RQ1与完全监督学习相比,自监督学习是否能提升医学影像中常见图像退化下的模型鲁棒性?
  • RQ2当在不同领域或采集协议的数据上部署时,自监督表示是否更具泛化能力?
  • RQ3为何自监督模型在干净数据性能相近的情况下,仍能在分布偏移下优于完全监督模型?
  • RQ4哪些类型的图像退化最能暴露自监督学习的鲁棒性优势?
  • RQ5自监督模型的优越泛化能力是否可归因于通过JigsawNet等预训练任务学习到的空间一致且不变的特征?

主要发现

  • 在亮度偏移、高斯模糊和分辨率变化等图像退化下,自监督学习的平均准确率显著高于完全监督学习(p < 0.001)。
  • 在多器官分割任务中,自监督模型在KITS2019上的Dice分数为0.670 ± 0.209,而完全监督模型仅为0.486 ± 0.246,p值为0.0002。
  • 自监督模型在高斯噪声、对比度变化和分辨率退化下表现更优,所有情况的p值均小于0.001。
  • 在定性分析中,自监督模型在高斯噪声下仍能保持预测一致性并正确分割器官,而完全监督模型则失败并出现标签翻转。
  • 自监督模型的鲁棒性归因于通过JigsawNet预训练任务学习空间关系,从而生成更强壮且更不变的特征表示。
  • 尽管在干净数据上性能相近,自监督模型在跨领域设置中表现出显著更好的泛化能力,表明鲁棒性是医学影像中SSL的关键隐藏优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。