[论文解读] Understanding Negative Samples in Instance Discriminative Self-supervised Representation Learning
本文解决了实例判别自监督学习中的一个悖论:尽管理论上预期增加负样本会导致性能下降,但实证结果却显示其能提升下游性能。本文提出了一套基于优惠券收集者问题的新型理论框架,表明更多负样本会隐式地将下游监督损失融入自监督目标,从而提升泛化能力,并在CIFAR-100和AGNews数据集上显著提高线性评估准确率。
Instance discriminative self-supervised representation learning has been attracted attention thanks to its unsupervised nature and informative feature representation for downstream tasks. In practice, it commonly uses a larger number of negative samples than the number of supervised classes. However, there is an inconsistency in the existing analysis; theoretically, a large number of negative samples degrade classification performance on a downstream supervised task, while empirically, they improve the performance. We provide a novel framework to analyze this empirical result regarding negative samples using the coupon collector's problem. Our bound can implicitly incorporate the supervised loss of the downstream task in the self-supervised loss by increasing the number of negative samples. We confirm that our proposed analysis holds on real-world benchmark datasets.
研究动机与目标
- 解决实例判别自监督学习中理论分析与实证观察之间的不一致问题,即增加负样本在理论上会降低性能,但实证中却能提升下游性能。
- 构建一种新的理论框架,以解释为何增加负样本数量能提升下游分类准确率。
- 通过基于优惠券收集者的全新边界,正式建立自监督损失与下游监督损失之间的联系。
- 在真实世界视觉与文本基准数据集(包括CIFAR-100和AGNews)上验证所提出的分析。
提出的方法
- 提出一种基于优惠券收集者问题的新下界,用于建模采样到所有唯一实例的概率。
- 推导出一个理论边界(公式10),其在负样本数量增加时保持稳定且不会发散,与先前的边界不同。
- 引入一个碰撞项(公式7),用于捕捉采样到重复表示的概率,这对控制泛化误差至关重要。
- 通过证明增加负样本数量会隐式地使表示空间向下游任务不变性方向正则化,从而建立自监督InfoNCE损失与下游监督损失之间的联系。
- 在视觉(CIFAR-100)和自然语言处理(AGNews)数据集上采用线性评估协议,通过实证结果验证理论主张。
- 在文本实验中使用改进的fastText模型,并通过使用预训练嵌入中相似词语替换的方式进行数据增强。
实验结果
研究问题
- RQ1为何在自监督表示学习中,增加负样本数量能实证提升下游分类准确率,尽管理论预测性能会下降?
- RQ2能否构建一个理论框架来解释在对比自监督学习中增加负样本数量的实证成功?
- RQ3优惠券收集者问题如何与自监督学习中实例判别法的泛化行为相关联?
- RQ4增加负样本数量在多大程度上能隐式地将下游监督损失融入自监督目标?
主要发现
- 所提出的边界(公式10)在负样本数量增加时保持稳定,不会发散,而现有基于CURL的边界(公式8)则迅速增长并变得无意义。
- 在CIFAR-100上,线性评估准确率从16个负样本时的75.3%提升至512个负样本时的76.5%,所提边界准确反映了这一趋势。
- 在AGNews上,线性准确率从88.74%提升至90.12%,随着负样本数量增加,所提边界表现出单调改善且无发散现象。
- 碰撞项(公式7)始终为负值,并随负样本数量增加而减小,表明表示多样性提升且冗余减少。
- 所提边界的监督损失上界(公式11)随负样本数量增加而逐渐上升,与观察到的性能提升一致。
- 该分析成功解释了SimCLR和MoCo等方法在使用大量负样本时取得实证成功的原因,揭示了其与隐式监督的内在联系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。