[论文解读] Center-wise Local Image Mixture For Contrastive Representation Learning
本文提出 CLIM,一种对比表示学习方法,通过基于中心的局部图像混合选择语义相似的正样本,提升特征泛化能力。结合聚类中心引导的正样本采样、基于 CutMix 的数据混合以及多分辨率增强,CLIM 在使用 ResNet-50 的 ImageNet 线性评估中达到 75.5% 的 top-1 准确率,仅用 200 个训练周期即超越 MoCo 4.8%。
Contrastive learning based on instance discrimination trains model to discriminate different transformations of the anchor sample from other samples, which does not consider the semantic similarity among samples. This paper proposes a new kind of contrastive learning method, named CLIM, which uses positives from other samples in the dataset. This is achieved by searching local similar samples of the anchor, and selecting samples that are closer to the corresponding cluster center, which we denote as center-wise local image selection. The selected samples are instantiated via an data mixture strategy, which performs as a smoothing regularization. As a result, CLIM encourages both local similarity and global aggregation in a robust way, which we find is beneficial for feature representation. Besides, we introduce \emph{multi-resolution} augmentation, which enables the representation to be scale invariant. We reach 75.5% top-1 accuracy with linear evaluation over ResNet-50, and 59.3% top-1 accuracy when fine-tuned with only 1% labels.
研究动机与目标
- 解决对比学习中实例判别方法的局限性,该方法忽略了样本之间的语义相似性。
- 通过在自监督学习中同时整合局部相似性和全局聚类结构,改进特征表示。
- 通过稳健的数据混合正则化降低弱监督对比学习中噪声正样本的影响。
- 通过多分辨率数据增强显式建模表示的尺度不变性。
- 在极小标注数据下实现最先进性能,尤其在低样本微调设置下表现优异。
提出的方法
- 提出基于中心的局部图像选择:对于每个锚点图像,识别其 k 个最近邻,并仅选择距离对应聚类中心更近的样本作为正样本。
- 引入一种数据混合策略(类似 CutMix),用于正则化对比损失,平滑预测并降低对噪声正样本的过度自信。
- 通过在不同分辨率下对比同一图像块(例如 224×224 和 160×160),实现多分辨率增强,显式建模尺度不变性。
- 使用 K-means 聚类定义聚类中心,以指导语义相关正样本的选择。
- 在混合表示上应用标准对比损失(如 MoCo 风格),结合局部相似性和全局聚类的优势。
- 使用标准自监督训练流程端到端优化模型,结合标准数据增强(如裁剪、颜色抖动等)与所提组件。
实验结果
研究问题
- RQ1基于与聚类中心的距离选择正样本,是否能超越实例判别方法,进一步提升表示学习?
- RQ2当正样本包含噪声时,通过 CutMix 实现的数据混合是否能有效正则化对比学习?
- RQ3显式进行多分辨率对比学习是否能增强自监督表示学习中的尺度不变性与性能?
- RQ4在低数据微调设置下,CLIM 表现如何,特别是在仅使用 1% 标注数据时?
- RQ5中心引导采样、数据混合与多分辨率增强的组合是否在各类基准上均带来一致性能提升?
主要发现
- CLIM 在使用 ResNet-50 的 ImageNet 线性评估中达到 75.5% 的 top-1 准确率,仅用 200 个训练周期即超越 MoCo v2 4.8%。
- 仅使用 1% 标注数据时,CLIM 在微调后达到 59.3% 的 top-1 准确率,优于完全监督基线模型在下游任务中的表现。
- 基于中心的正样本采样相比 KNN+K-means 选择提升 1.3%,相比标准 MoCo v2 提升 1.8%。
- 基于 CutMix 的数据混合在所有采样策略下均一致提升准确率,相比无混合策略最高提升 1.8%。
- 使用 224×224 和 160×160 图像块的多分辨率增强实现 72.3% 的准确率,显著优于多裁剪基线(69.7%)和使用 800 个周期的 MoCo(71.1%)。
- 消融实验证实,中心引导采样、CutMix 和多分辨率增强的组合带来最强性能,各组件贡献递增。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。