[论文解读] Inter-Instance Similarity Modeling for Contrastive Learning
本文提出 PatchMix,一种针对视觉 Transformer 的新型图像混合方法,通过在小批量中随机组合多张图像的图像块,建模丰富的跨实例相似性。通过在图像块级别实现多图像混合,PatchMix 通过混合到原始图像、混合到混合图像以及原始图像到原始图像的对比学习,显著提升了表示学习性能,在 ImageNet-1K 上实现 3.0% 的线性准确率提升,在 CIFAR100 上实现 8.7% 的 kNN 准确率改进,达到当前最优水平。
The existing contrastive learning methods widely adopt one-hot instance discrimination as pretext task for self-supervised learning, which inevitably neglects rich inter-instance similarities among natural images, then leading to potential representation degeneration. In this paper, we propose a novel image mix method, PatchMix, for contrastive learning in Vision Transformer (ViT), to model inter-instance similarities among images. Following the nature of ViT, we randomly mix multiple images from mini-batch in patch level to construct mixed image patch sequences for ViT. Compared to the existing sample mix methods, our PatchMix can flexibly and efficiently mix more than two images and simulate more complicated similarity relations among natural images. In this manner, our contrastive framework can significantly reduce the gap between contrastive objective and ground truth in reality. Experimental results demonstrate that our proposed method significantly outperforms the previous state-of-the-art on both ImageNet-1K and CIFAR datasets, e.g., 3.0% linear accuracy improvement on ImageNet-1K and 8.7% kNN accuracy improvement on CIFAR100. Moreover, our method achieves the leading transfer performance on downstream tasks, object detection and instance segmentation on COCO dataset. The code is available at https://github.com/visresearch/patchmix
研究动机与目标
- 解决现有对比学习方法依赖 one-hot 实例判别所带来的局限性,该方法忽略了自然图像中丰富的跨实例相似性。
- 克服对比学习中单调的相似性目标,该目标无法捕捉来自同一图像的正样本对之外的类内与类间相似性。
- 通过无监督方式建模多张图像之间复杂的软相似性关系,提升无监督表示学习性能。
- 增强自监督模型的泛化能力与可迁移性,尤其针对物体检测和实例分割等对局部结构敏感的下游任务。
- 开发一种与视觉 Transformer 兼容的图像块级别混合策略,实现多于两张图像的灵活、高效混合。
提出的方法
- 提出 PatchMix,一种图像块级别的图像混合方法,通过在小批量中随机组合多张图像的图像块序列,生成混合图像序列。
- 通过从不同源图像中采样图像块来构建混合图像,保留局部视觉组件(例如狗头、鸟翼)以模拟真实的跨实例相似性。
- 设计三流对比学习框架:混合到原始图像、混合到混合图像以及原始图像到原始图像的对比,以建模多样的相似性关系。
- 在对比学习目标中使用温度缩放的相似性度量,以稳定训练并提升表示质量。
- 利用视觉 Transformer 的固有序列特性,通过非连续图像块混合保持长距离依赖学习能力。
- 使用联合对比学习目标联合训练 ViT 模型,平衡来自混合图像、原始图像以及混合图像对混合图像样本的正样本对。
实验结果
研究问题
- RQ1建模多张图像之间的更丰富跨实例相似性,是否能够提升对比学习中的自监督表示学习?
- RQ2多图像图像块级别混合与传统的两图像混合方法(如 Mixup 和 CutMix)相比,在捕捉复杂视觉相似性方面表现如何?
- RQ3PatchMix 在多大程度上缩小了对比学习目标与真实世界图像相似性分布之间的差距?
- RQ4PatchMix 是否能提升在需要细粒度局部结构理解的下游任务(如物体检测和实例分割)上的迁移性能?
- RQ5PatchMix 是否能在不增加额外数据的情况下,缓解在小规模数据集(如 CIFAR10 和 CIFAR100)上的表示退化与过拟合问题?
主要发现
- 与先前最先进方法相比,PatchMix 在 ImageNet-1K 上的线性评估准确率提升了 3.0%。
- 在 CIFAR100 上,PatchMix 的 kNN 准确率提升了 8.7%,表明其具有更强的泛化能力和表示质量。
- 在 COCO 数据集上,PatchMix 在物体检测和实例分割任务中均达到最先进性能,证实了其强大的可迁移性。
- 随着预训练周期的延长,性能持续提升,在 800 个周期时趋于饱和,表明训练动态稳定且可扩展。
- 可视化结果表明,与 DINO 或 SDMP 相比,PatchMix 在相关图像和同类别图像之间建立了显著更丰富的相似性分布。
- 使用 PatchMix 训练的模型在捕捉不同图像实例之间的组件级相似性方面表现出更优的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。