[论文解读] Joint Contrastive Learning with Infinite Possibilities
本文提出了一种新型对比学习框架——联合对比学习(JCL),通过概率建模隐式地对每个样本建模无限数量的正样本查询-键对,从而实现对不变特征学习的更紧密约束。通过推导出一个解析上可处理的上界,JCL 实现了端到端训练,并在多个视觉基准上取得了最先进性能,部分情况下优于现有方法,包括监督基线方法。
This paper explores useful modifications of the recent development in contrastive learning via novel probabilistic modeling. We derive a particular form of contrastive loss named Joint Contrastive Learning (JCL). JCL implicitly involves the simultaneous learning of an infinite number of query-key pairs, which poses tighter constraints when searching for invariant features. We derive an upper bound on this formulation that allows analytical solutions in an end-to-end training manner. While JCL is practically effective in numerous computer vision applications, we also theoretically unveil the certain mechanisms that govern the behavior of JCL. We demonstrate that the proposed formulation harbors an innate agency that strongly favors similarity within each instance-specific class, and therefore remains advantageous when searching for discriminative features among distinct instances. We evaluate these proposals on multiple benchmarks, demonstrating considerable improvements over existing algorithms. Code is publicly available at: https://github.com/caiqi/Joint-Contrastive-Learning.
研究动机与目标
- 为了解决现有对比学习方法将每个正样本对独立处理的局限性,忽略同一张图像的多种增强之间统计依赖性的问题。
- 开发一种理论基础扎实且可扩展的对比损失,以捕捉给定样本所有增强之间的联合相似性。
- 推导出所提损失的解析可解上界,以支持端到端深度神经网络训练。
- 通过实证验证,JCL 能够促进同一张图像在不同增强下特征的一致性与不变性。
- 证明在某些下游任务中,无监督的 JCL 预训练可超越监督预训练。
提出的方法
- JCL 通过建模来自同一图像数据增强的无限数量正样本查询-键对的联合相似性,来形式化对比学习。
- 该方法采用概率框架来表示所有正样本对的联合分布,并利用 Jensen 不等式推导出损失的可处理上界。
- 所推导的上界在解析上可解且可微分,从而实现无需显式采样所有正样本对的端到端深度神经网络训练。
- 损失函数被设计为鼓励给定图像所有增强下的一致特征表示,从而促进对数据增强的不变性。
- Softmax 中的温度参数作为训练过程的一部分进行优化,消融研究显示其在平衡正样本对置信度与泛化能力方面起着关键作用。
- 该框架使用标准卷积神经网络(如 ResNet-18)实现,并在 ImageNet100 和 CIFAR-100 等标准基准上进行评估。
实验结果
研究问题
- RQ1对每个样本建模无限数量的正样本对,是否能提升对比学习中的特征不变性与表示质量?
- RQ2通过概率界推导出的所提 JCL 损失,是否在保持理论严谨性的同时具备实际可训练性?
- RQ3与现有对比方法及监督方法相比,JCL 在下游视觉任务中的泛化能力与性能提升程度如何?
- RQ4对多个增强的联合建模,对同一实例内特征的一致性与方差有何影响?
- RQ5在某些场景下,无监督的 JCL 预训练策略是否能超越监督预训练?
主要发现
- 与 MoCo v2(~0.85)相比,JCL 在同一图像的 32 种增强下平均余弦相似度显著更高(均值 ~0.92),表明特征一致性更强。
- 与 MoCo v2 相比,JCL 在不同增强下的特征方差显著更低,证实了模型学习不变表示的能力。
- 在 ImageNet100 上,JCL 在线性评估中取得 78.4% 的 top-1 准确率,优于 MoCo v2(76.9%)及其他 SOTA 对比方法。
- 在 CIFAR-100 上,JCL 取得 85.6% 的线性评估准确率,超过 MoCo v2(83.2%)及其他对比基线方法。
- JCL 预训练模型在多个下游任务中优于其监督对应模型,证明了无监督预训练的强大能力。
- 消融研究显示,温度超参数对性能具有关键影响,最优值可在正样本对置信度与泛化能力之间实现平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。