[论文解读] Targeted Supervised Contrastive Learning for Long-Tailed Recognition
本文提出目标监督对比学习(TSC),一种通过在超球面上生成均匀分布的目标点,并在训练过程中将类别特征对齐到这些目标点,从而改善长尾识别的方法。TSC 提升了特征空间的均匀性,尤其对少数类表现更优,在 CIFAR-10-LT、CIFAR-100-LT、ImageNet-LT 和 iNaturalist 数据集上均实现了最先进性能,有效缓解了数据分布不平衡带来的偏差影响。
Real-world data often exhibits long tail distributions with heavy class imbalance, where the majority classes can dominate the training process and alter the decision boundaries of the minority classes. Recently, researchers have investigated the potential of supervised contrastive learning for long-tailed recognition, and demonstrated that it provides a strong performance gain. In this paper, we show that while supervised contrastive learning can help improve performance, past baselines suffer from poor uniformity brought in by imbalanced data distribution. This poor uniformity manifests in samples from the minority class having poor separability in the feature space. To address this problem, we propose targeted supervised contrastive learning (TSC), which improves the uniformity of the feature distribution on the hypersphere. TSC first generates a set of targets uniformly distributed on a hypersphere. It then makes the features of different classes converge to these distinct and uniformly distributed targets during training. This forces all classes, including minority classes, to maintain a uniform distribution in the feature space, improves class boundaries, and provides better generalization even in the presence of long-tail data. Experiments on multiple datasets show that TSC achieves state-of-the-art performance on long-tailed recognition tasks.
研究动机与目标
- 解决监督对比学习中因长尾数据分布导致的特征空间均匀性差的问题。
- 在不损害头部类别性能的前提下,提升少数类在数据不平衡数据集中的泛化能力与可分性。
- 开发一种方法,无论训练数据的不平衡比率如何,均能保持特征分布的平衡性。
- 通过将特征对齐至空间上合适的靶点,确保类别间的语义相似性在特征空间中得以保留。
- 提供一种稳定且可扩展的长尾识别解决方案,优于现有对比学习基线方法。
提出的方法
- 使用随机梯度下降在超球面上生成最优且均匀分布的靶点,以最小化均匀性损失。
- 通过在线匹配机制将每个类别分配至一个靶点,该机制尊重类别之间的语义相似性。
- 使用对比损失训练模型,促使每个类别的特征向其分配的靶点收敛。
- 采用类似 KCL 的平衡正样本采样策略,以改善类内对齐,尽管由于靶点对齐本身已具备内在平衡性,该策略的增益有所降低。
- 应用在线匹配算法,在训练过程中动态地将靶点分配给类别,以保持语义结构。
- 通过在多个随机种子上评估均匀性损失,确保靶点生成的稳定性,结果显示方差可忽略不计。

实验结果
研究问题
- RQ1在长尾数据分布下,监督对比学习能否维持均匀的特征分布?还是类别不平衡会降低均匀性与泛化能力?
- RQ2为类别预设均匀分布的靶点是否能提升长尾识别中特征空间的均匀性及少数类的性能?
- RQ3与随机或固定靶点分配相比,类别与靶点的在线匹配对语义一致性与模型泛化能力有何影响?
- RQ4TSC 在不损害头部类别准确率的前提下,能在多大程度上减轻尾部类别性能下降?
- RQ5靶点生成过程在不同随机种子和类别数量下是否稳定且鲁棒?
主要发现
- 在 CIFAR-10-LT 上,TSC 实现了 63.5% 的总体准确率,优于 KCL(52.4%)和 FCL(51.8%),达到最先进水平。
- 在 ImageNet-LT 上,TSC 在多张样本类别上达到 63.5% 的准确率,中等样本类为 49.7%,少样本类为 30.4%,总体准确率为 52.4%,优于 KCL 和 FCL。
- TSC 中的在线匹配算法将风险评分(R)从随机分配的 7.81 降低至 7.14,表明泛化能力更强,特征学习更均衡。
- 即使在极高不平衡比率(如 100:1:1)下,TSC 仍能保持特征空间的高均匀性,而 KCL 显示出少数类特征严重坍塌。
- 靶点生成过程具有高度稳定性,多个随机种子下均匀性损失波动小于 3e-6,证实其鲁棒性。
- 与 KCL 相比,TSC 中平衡正样本采样的收益更小,表明靶点驱动的对齐机制本身已自然实现类内对齐的平衡。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。