Skip to main content
QUICK REVIEW

[论文解读] EqCo: Equivalent Rules for Self-supervised Contrastive Learning

Benjin Zhu, Junqiang Huang|arXiv (Cornell University)|Oct 5, 2020
Domain Adaptation and Few-Shot Learning参考文献 53被引用 4
一句话总结

EqCo 提出了一种理论基础扎实的方法,通过根据负样本数量动态调整 InfoNCE 损失中的边界项,从而稳定对比自监督学习,使模型在每个查询仅使用 16 个负样本时仍能实现高性能。该方法消除了对大批次训练或内存库的依赖,在 ImageNet 线性评估中的准确率与 MoCo v2 相当,但每个查询仅使用 16 对负样本。

ABSTRACT

In this paper, we propose EqCo (Equivalent Rules for Contrastive Learning) to make self-supervised learning irrelevant to the number of negative samples in the contrastive learning framework. Inspired by the InfoMax principle, we point that the margin term in contrastive loss needs to be adaptively scaled according to the number of negative pairs in order to keep steady mutual information bound and gradient magnitude. EqCo bridges the performance gap among a wide range of negative sample sizes, so that for the first time, we can use only a few negative pairs (e.g., 16 per query) to perform self-supervised contrastive training on large-scale vision datasets like ImageNet, while with almost no accuracy drop. This is quite a contrast to the widely used large batch training or memory bank mechanism in current practices. Equipped with EqCo, our simplified MoCo (SiMo) achieves comparable accuracy with MoCov2 on ImageNet (linear evaluation protocol) while only involves 16 negative pairs per query instead of 65536, suggesting that large quantities of negative samples is not a critical factor in contrastive learning frameworks.

研究动机与目标

  • 解决关于在对比自监督学习中是否必须使用大量负样本的实证与理论不确定性。
  • 在负样本数量变化时,稳定对比学习中的互信息下界与梯度幅值。
  • 开发一种在不同负样本数量下均能保持一致性能的方法,尤其适用于小 K 的情况。
  • 证明当损失函数被正确校准时,大规模负样本采样并非对比学习中的关键因素。
  • 为对比表示学习中的大批次训练与内存库机制提供一种理论基础扎实的替代方案。

提出的方法

  • 提出一种等价规则,根据负样本数量 K 动态缩放 InfoNCE 损失中的边界项,确保互信息下界稳定。
  • 推导出一个条件(公式 5),使得不同 K 值下的 InfoNCE 损失在互信息估计方面具有等价性。
  • 提出一种新的损失形式,其中边界项通过可学习超参数 α 自适应调整,以控制有效负样本数量。
  • 采用温度缩放的对比损失,并引入自适应边界项,以在不同 K 值下保持一致的梯度幅值。
  • 通过使用相关高斯变量的简化互信息估计任务验证该方法,结果表明无论 K 为何值,EqCo 均能实现稳定的互信息估计。
  • 将 EqCo 应用于简化版 MoCo 变体(SiMo),用小 K=16 取代大批次内存库,并在 ImageNet 上进行训练。

实验结果

研究问题

  • RQ1在对比学习中,增加负样本数量带来的性能提升,其根本原因是否是互信息估计的改善,还是梯度幅值不平衡的副产物?
  • RQ2通过适当的损失校准,能否在不同负样本数量 K 下稳定对比学习中的互信息下界?
  • RQ3对比学习中对大批次训练或内存库的需求,是否源于边界项未正确缩放,而非负样本数量本身?
  • RQ4当损失函数被正确校准时,是否可用少量负样本(如 K=16)实现与大批次方法(如 K=65536)相当的性能?
  • RQ5具有自适应边界的 InfoNCE 损失(即 EqCo)是否可推广至 MoCo 以外的其他对比学习框架?

主要发现

  • EqCo 在不同 K 值下均能稳定互信息下界与梯度幅值,使对比损失对负样本数量不敏感。
  • 在 ImageNet 线性评估协议下,SiMo 搭配 EqCo 且每个查询仅使用 16 对负样本时,top-1 准确率达到 71.8%,与使用 65,536 个负样本的 MoCo v2 相当。
  • 在简化互信息估计任务中,EqCo 在所有 K 值下均能稳定估计接近真实值的互信息,而标准 InfoNCE 则低估互信息,且随着 K 增大,偏差愈发明显。
  • 当 K ≤ 16 时,即使使用 EqCo,MoCo v2 的性能仍显著下降,表明模型架构与训练动态也会影响方法的有效性。
  • 当使用 EqCo 时,K 值从 256 增加到 65536 的性能增益趋于平缓,表明收益递减。
  • EqCo 使简化版 MoCo 变体(SiMo)在大幅降低计算成本与内存使用的情况下,达到与 MoCo v2 相当的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。