[论文解读] Exploring Image Augmentations for Siamese Representation Learning with Chest X-Rays
本文研究了在胸部X光片分析中,用于孪生表示学习的最优图像增强策略,表明随机缩放裁剪结合特定增强方法(如噪声或Sobel滤波)可生成鲁棒且可泛化的表示。这些自监督表示在零样本迁移和线性探测任务中,相较于监督基线模型,性能最高提升20%,在三个大型数据集(MIMIC-CXR、CheXpert、VinDr-CXR)上表现优异,尤其在罕见病和分布外疾病上表现突出。
Image augmentations are quintessential for effective visual representation learning across self-supervised learning techniques. While augmentation strategies for natural imaging have been studied extensively, medical images are vastly different from their natural counterparts. Thus, it is unknown whether common augmentation strategies employed in Siamese representation learning generalize to medical images and to what extent. To address this challenge, in this study, we systematically assess the effect of various augmentations on the quality and robustness of the learned representations. We train and evaluate Siamese Networks for abnormality detection on chest X-Rays across three large datasets (MIMIC-CXR, CheXpert and VinDR-CXR). We investigate the efficacy of the learned representations through experiments involving linear probing, fine-tuning, zero-shot transfer, and data efficiency. Finally, we identify a set of augmentations that yield robust representations that generalize well to both out-of-distribution data and diseases, while outperforming supervised baselines using just zero-shot transfer and linear probes by up to 20%. Our code is available at https://github.com/StanfordMIMI/siaug.
研究动机与目标
- 评估多样化图像增强策略对医学影像中自监督表示学习的影响,特别是针对胸部X光片。
- 确定自然图像自监督学习中常用增强技术是否可泛化至医学图像。
- 评估所学表示在多个数据集和下游任务中的鲁棒性与泛化能力。
- 在零样本、线性探测和微调设置下,比较自监督表示与监督基线模型的性能。
- 识别出一组最小增强策略,以生成在罕见病和分布外病理情况下的高性能、可泛化特征。
提出的方法
- 本研究采用孪生对比学习框架,通过多种增强对生成同一张胸部X光片的正样本视图。
- 在MIMIC-CXR数据集上进行预训练,采用多种增强组合,包括随机缩放裁剪、噪声、Sobel滤波、旋转和形变。
- 通过线性探测、零样本迁移、微调和数据效率实验,在MIMIC-CXR、CheXpert和VinDr-CXR上进行下游评估。
- 使用宏AUROC衡量性能,涵盖常见(如肺炎)和罕见(如肋骨骨折、结核)病理类型。
- 在分布偏移和标签漂移条件下评估框架的鲁棒性。
- 消融研究比较不同增强对与对比学习变体(如SimSiam、SimCLR、MoCo、DINO)的差异,以隔离增强选择的影响。

实验结果
研究问题
- RQ1哪些图像增强策略能在自监督孪生学习中为胸部X光片生成最鲁棒且可泛化的表示?
- RQ2在零样本和线性探测设置下,不同增强策略所学表示与监督基线相比表现如何?
- RQ3这些自监督表示在多大程度上能泛化至分布外疾病和数据集?
- RQ4增强策略的选择如何影响对罕见病理(如肋骨骨折和结核)的性能?
- RQ5在无微调情况下,仅在一个数据集(如MIMIC-CXR)上预训练的自监督表示能否在未见数据集(如VinDr-CXR)上实现强性能?
主要发现
- 随机缩放裁剪是最关键的增强策略,其在所有下游任务中基本决定了最优性能。
- 最佳增强对(裁剪与缩放结合噪声或Sobel滤波)在内部测试集的零样本迁移中,AUROC最高比监督基线提升20.0%。
- 在外部评估(VinDr-CXR)中,最佳自监督模型在零样本迁移中比监督基线最高提升27.0%。
- 所学表示对罕见和未见病理(包括结核和肋骨骨折)泛化良好,表现出对分布偏移的鲁棒性。
- 使用自监督特征进行线性探测和小样本微调,其准确率超过从零开始训练的完全监督模型。
- 表示对标签漂移和灾难性遗忘具有韧性,在不同数据分布下均保持稳定性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。