[论文解读] Comparing to Learn: Surpassing ImageNet Pretraining on Radiographs By Comparing Image Representations
本文提出了一种自监督预训练方法——比较学习(Comparing to Learn, C2L),用于X光片,通过在无标注数据上比较图像表征来学习鲁棒特征。利用70万张未标注X光片上的批量混合(batch mixup)与基于动量的师生对比框架,C2L在多个医学影像基准测试中超越了ImageNet预训练和当前最先进基线方法,在ChestX-ray14数据集上AUROC最高提升2.0%,在CheXpert数据集上提升1.4%(使用DenseNet-121)。
In deep learning era, pretrained models play an important role in medical image analysis, in which ImageNet pretraining has been widely adopted as the best way. However, it is undeniable that there exists an obvious domain gap between natural images and medical images. To bridge this gap, we propose a new pretraining method which learns from 700k radiographs given no manual annotations. We call our method as Comparing to Learn (C2L) because it learns robust features by comparing different image representations. To verify the effectiveness of C2L, we conduct comprehensive ablation studies and evaluate it on different tasks and datasets. The experimental results on radiographs show that C2L can outperform ImageNet pretraining and previous state-of-the-art approaches significantly. Code and models are available.
研究动机与目标
- 通过直接从无标注医学图像中学习表征,解决ImageNet预训练所用自然图像与医学X光片之间的领域差距。
- 开发一种自监督预训练方法,避免依赖昂贵的医学标注,同时提升下游任务性能。
- 探究通过比较医学图像表征来学习是否能超越ImageNet预训练的泛化能力。
- 证明基于特征级相似性的对比学习可为放射学任务生成更优的表征。
提出的方法
- C2L采用基于动量的师生框架,其中学生网络通过反向传播更新,教师网络则通过动量更新规则更新。
- 该方法在增强后的图像批次上应用批量混合(batch-wise mixup),以生成同质与异质图像对,从而实现在图像和特征层面的对比学习。
- 对教师网络的输出特征应用特征混合(feature mixup),以生成额外的正样本对,增强表征学习能力。
- 使用记忆队列存储教师网络过去的特征,作为对比损失计算中的负样本键。
- 对比损失通过预测相似度分数与one-hot真实标签之间的交叉熵计算,其中正样本对为来自同一图像的匹配特征,负样本对来自记忆队列。
- 训练过程交替进行在增强和混合批次上的前向传播:学生网络在对比损失上进行训练,教师网络则通过动量规则更新。
实验结果
研究问题
- RQ1在无标注X光片上进行自监督表征学习,是否能在医学影像分析中超越ImageNet预训练?
- RQ2通过混合(mixup)与对比损失学习图像表征比较,是否能产生比传统图像恢复或重建掩蔽任务更鲁棒的特征?
- RQ3与Model Genesis和MoCo等当前最先进自监督方法相比,C2L在多样化放射学任务与数据集上的表现如何?
- RQ4所提出的混合与动量对比学习框架在低资源医学影像场景中,能在多大程度上提升泛化能力?
主要发现
- 在ChestX-ray14数据集上,C2L使用DenseNet-121达到84.4%的平均AUROC,比ImageNet预训练高出1.5个百分点。
- 在CheXpert数据集上,C2L使用DenseNet-121达到89.3%的平均AUROC,比ImageNet预训练高出1.4个百分点。
- 在Kaggle肺炎检测数据集上,C2L在0.6置信度阈值下的平均精度达到23.9%,显著优于ImageNet预训练(22.2%)和MoCo(22.4%)。
- C2L在所有评估的数据集和网络架构上均持续超越Model Genesis和MoCo,证明其在学习领域特定表征方面的优越性。
- 消融实验确认,批量混合与特征混合均对性能有显著贡献,且动量对比机制增强了特征判别能力。
- 该方法在无需任何人工标注数据的情况下达到最先进性能,证明在无配对、无标注X光片上进行表征比较,可生成优于ImageNet预训练的特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。