Skip to main content
QUICK REVIEW

[论文解读] MixSiam: A Mixture-based Approach to Self-supervised Representation Learning

X. Guo, Tianhao Zhao|arXiv (Cornell University)|Nov 4, 2021
Domain Adaptation and Few-Shot Learning参考文献 51被引用 8
一句话总结

MixSiam 提出了一种基于混合的自监督学习方法,通过引入 MixUp 生成的困难增强样本,并强制对通过特征最大化获得的判别性表示实现不变性,从而增强了孪生对比学习。该方法在 ImageNet 和小规模数据集上实现了最先进性能,提升了模型的鲁棒性和泛化能力,在相同训练设置下,ImageNet 上的准确率相比 SimSiam 最高提升了 0.64%。

ABSTRACT

Recently contrastive learning has shown significant progress in learning visual representations from unlabeled data. The core idea is training the backbone to be invariant to different augmentations of an instance. While most methods only maximize the feature similarity between two augmented data, we further generate more challenging training samples and force the model to keep predicting discriminative representation on these hard samples. In this paper, we propose MixSiam, a mixture-based approach upon the traditional siamese network. On the one hand, we input two augmented images of an instance to the backbone and obtain the discriminative representation by performing an element-wise maximum of two features. On the other hand, we take the mixture of these augmented images as input, and expect the model prediction to be close to the discriminative representation. In this way, the model could access more variant data samples of an instance and keep predicting invariant discriminative representations for them. Thus the learned model is more robust compared to previous contrastive learning methods. Extensive experiments on large-scale datasets show that MixSiam steadily improves the baseline and achieves competitive results with state-of-the-art methods. Our code will be released soon.

研究动机与目标

  • 为解决孪生对比学习在处理类内大变化时鲁棒性有限的问题。
  • 通过引入超越标准数据增强的困难且多样的训练样本,提升模型泛化能力。
  • 通过学习同一图像的两个增强视图中最具信息量的表示,增强特征判别能力。
  • 通过利用更强的不变性约束,在更小的批量大小下实现具有竞争力的性能。

提出的方法

  • 模型采用共享权重的孪生编码器结构,处理同一图像的两个增强视图。
  • 通过逐元素最大值操作,将两个增强视图的特征表示合并,形成捕捉最相关信息特征的判别性表示。
  • 通过线性混合两个增强视图,生成第三个输入,形成模型需要预测的困难且具有挑战性的样本。
  • 预测头被训练以生成与判别性表示相似的预测结果,从而在多样化输入间强制实现不变性。
  • 加权损失函数结合了正样本对的对比损失和混合样本的一致性损失,超参数 λ 平衡两项损失。
  • 该方法利用标准数据增强(裁剪、颜色抖动、模糊、随机灰度化)和 MixUp,生成多样化的训练样本。

实验结果

研究问题

  • RQ1通过 MixUp 引入困难的虚拟样本,能否提升孪生对比学习框架中自监督表示学习的鲁棒性?
  • RQ2将增强视图间的特征最大化与对混合样本的不变性相结合,是否能带来优于标准对比学习的泛化性能?
  • RQ3简单正样本对与困难混合样本之间的平衡如何影响模型性能,其最优权衡是什么?
  • RQ4与最先进方法相比,MixSiam 是否能在更小批量大小下实现具有竞争力的准确率?

主要发现

  • 在 CIFAR-10 上,MixSiam 达到 93.35% 的 top-1 准确率,相比 SimSiam 基线最高提升 0.64%。
  • 在 ImageNet 上,MixSiam 在批量大小为 256 的条件下达到 81.9% 的 top-1 准确率,与类似训练条件下最先进方法相当或更优。
  • 消融实验表明,特征最大化(最大值聚合)性能最佳,相比平均池化提升准确率 0.64%。
  • 超参数 λ = 0.5 提供最优权衡,平衡两项损失组件,并在所有数据集上实现最高性能。
  • 可视化显示,混合图像在视觉上呈现模糊且包含重叠特征,使其预测更具挑战性,从而提升模型鲁棒性。
  • 该方法在多个基准测试(包括 CIFAR-10、CIFAR-100 和 Food101)上持续提升性能,展现出强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。