[论文解读] Self-Damaging Contrastive Learning
本文提出自损对比学习(SDCLR),一种新颖的无监督表示学习框架,通过动态剪枝目标模型以创建‘自竞争者’,从而提升对长尾数据的鲁棒性。通过对比完整模型与剪枝后的模型,SDCLR 隐式识别并强调难以学习的长尾样本,在全样本和少样本设置下的线性评估中,显著提升了整体准确率与平衡准确率。
The recent breakthrough achieved by contrastive learning accelerates the pace for deploying unsupervised training on real-world data applications. However, unlabeled data in reality is commonly imbalanced and shows a long-tail distribution, and it is unclear how robustly the latest contrastive learning methods could perform in the practical scenario. This paper proposes to explicitly tackle this challenge, via a principled framework called Self-Damaging Contrastive Learning (SDCLR), to automatically balance the representation learning without knowing the classes. Our main inspiration is drawn from the recent finding that deep models have difficult-to-memorize samples, and those may be exposed through network pruning. It is further natural to hypothesize that long-tail samples are also tougher for the model to learn well due to insufficient examples. Hence, the key innovation in SDCLR is to create a dynamic self-competitor model to contrast with the target model, which is a pruned version of the latter. During training, contrasting the two models will lead to adaptive online mining of the most easily forgotten samples for the current target model, and implicitly emphasize them more in the contrastive loss. Extensive experiments across multiple datasets and imbalance settings show that SDCLR significantly improves not only overall accuracies but also balancedness, in terms of linear evaluation on the full-shot and few-shot settings. Our code is available at: https://github.com/VITA-Group/SDCLR.
研究动机与目标
- 解决对比学习在真实应用场景中对长尾、不平衡无标签数据的脆弱性问题。
- 开发一种与类别无关的方法,自动平衡表示学习,而无需事先了解类别分布。
- 利用模型记忆动态特性——特别是深层网络在剪枝后倾向于遗忘长尾样本的倾向——作为自适应样本挖掘的信号。
- 在长尾数据划分下的线性评估协议中,提升下游任务的整体与平衡性能。
提出的方法
- SDCLR 引入双分支架构:一个主目标模型和一个在训练过程中动态剪枝生成的‘自竞争者’模型。
- 自竞争者通过基于权重大小的剪枝从目标模型生成,剪枝过程在线进行,并与目标模型同步更新。
- 两个分支对未剪枝参数共享权重,同时保持独立的批归一化层,以保留表示多样性。
- 在相同输入下,计算目标分支与自竞争者分支的特征表示之间的对比损失,鼓励对齐,同时强调受剪枝影响最大的样本。
- 该方法隐式将特征变化显著的样本识别为长尾样本,因此在损失中获得更高关注。
- 该框架与标准对比学习流程(如 SimCLR)兼容,无需修改数据分布或引入类别特定的损失加权。
实验结果
研究问题
- RQ1能否将模型剪枝用作无监督、与类别无关的手段,以识别难以学习的长尾样本?
- RQ2将完整模型与剪枝版本进行对比,是否能提升在长尾数据分布上的表示学习鲁棒性?
- RQ3在长尾设置下,SDCLR 与标准对比学习及其他基线方法相比,在线性可分性和少样本准确率方面表现如何?
- RQ4在模型容量与有效挖掘困难样本之间,最优剪枝比例是多少?
主要发现
- SDCLR 在长尾 CIFAR100 划分上显著提升了线性评估准确率,达到 48.23% ± 0.20% 的线性可分性与 24.68% ± 0.36% 的少样本准确率,优于 SimCLR 与 MocoV2。
- 该方法缩小了高频类与低频类之间的性能差距,小类别样本在剪枝后特征变化中的影响力相比多数类样本提升了 3.5 倍。
- 消融实验表明,剪枝比例存在显著权衡:性能在约 90% 剪枝时达到峰值,超过该比例后模型容量损失导致性能下降。
- 随机丢弃基线(90% 丢弃)仅获得 15.48% ± 0.42% 的少样本准确率,证实结构化剪枝对有效样本挖掘至关重要。
- Grad-CAM 可视化结果表明,与 SimCLR 相比,SDCLR 在尾部类别图像上学习到更具判别性的注意力图,表明其能更好地定位与类别相关特征。
- 即使稀疏分支本身表现较弱,也能提升密集目标模型的泛化能力,证明了共进化学习的益处。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。