[论文解读] Deep Bregman Divergence for Contrastive Learning of Visual Representations
本文提出了一种新颖的对比学习框架,利用深度Bregman散度捕捉视觉表征中的分布级差异,从而在超越欧几里得距离的基础上提升特征质量。通过训练多个线性子网络以计算功能型Bregman散度,并将其与传统的对比损失相结合,该方法在自监督和半监督学习基准上实现了图像分类和目标检测任务的最先进性能。
Deep Bregman divergence measures divergence of data points using neural networks which is beyond Euclidean distance and capable of capturing divergence over distributions. In this paper, we propose deep Bregman divergences for contrastive learning of visual representation where we aim to enhance contrastive loss used in self-supervised learning by training additional networks based on functional Bregman divergence. In contrast to the conventional contrastive learning methods which are solely based on divergences between single points, our framework can capture the divergence between distributions which improves the quality of learned representation. We show the combination of conventional contrastive loss and our proposed divergence loss outperforms baseline and most of the previous methods for self-supervised and semi-supervised learning on multiple classifications and object detection tasks and datasets. Moreover, the learned representations generalize well when transferred to the other datasets and tasks. The source code and our models are available in supplementary and will be released with paper.
研究动机与目标
- 通过捕捉超越点对点距离的分布级差异,改进自监督视觉表征学习。
- 通过功能型Bregman散度扩展对比学习,实现在数据分布上的更精细度量学习。
- 开发一个端到端可训练的框架,联合优化传统的对比损失与新型散度损失。
- 提升特征在不同数据集和任务间的泛化能力与可迁移性。
- 探究Bregman散度在自监督和半监督场景下的度量学习中的有效性。
提出的方法
- 该框架使用基础编码器和投影头,从增强的图像对中生成嵌入。
- 训练多个深度线性子网络,以参数化功能型Bregman散度的凸生成函数。
- 利用这些子网络在嵌入之间计算Bregman散度,捕捉分布级差异。
- 引入对比散度损失,通过可学习的高斯核函数将Bregman散度转换为相似性分数。
- 整体损失结合标准的NT-Xent对比损失与新型散度损失,并进行端到端优化。
- 通过贝叶斯优化调整超参数λ和σ,以在下游任务上最大化性能。
实验结果
研究问题
- RQ1功能型Bregman散度是否能在对比学习中超越点对点距离,改善视觉表征学习?
- RQ2将Bregman散度损失与传统对比损失结合,如何影响表征质量与下游任务性能?
- RQ3与现有自监督和半监督学习方法相比,该方法在不同数据集和任务上的泛化能力是否更优?
- RQ4将Bregman散度映射为相似性分数的转换函数ψ的最优形式是什么?
- RQ5不同超参数λ和σ如何影响对比散度损失的性能?
主要发现
- 所提方法在自监督和半监督学习基准上,于图像分类和目标检测任务中均优于基线方法和大多数先前方法。
- 在CIFAR-10上,使用最佳超参数λ=5和σ=1.5时,模型达到了94.2%的Top-1准确率,该参数通过贝叶斯优化获得。
- t-SNE可视化显示,与SimCLR相比,类别0、1、8和9的聚类分离效果更优,表明特征判别能力提升。
- 在所有测试函数中,使用σ=1.5的高斯核作为转换函数ψ时性能最佳。
- 传统对比损失与新型散度损失的结合,使表征在迁移学习场景中更具鲁棒性和泛化能力。
- 该方法表现出强大的可迁移性,在标准基准和近期临床数据集上均表现出高绩效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。