[论文解读] Improving Transformation Invariance in Contrastive Representation Learning
本文提出一种基于梯度的正则化方法,显式地在对比表示学习中强制实现变换不变性,从而提升模型的鲁棒性与下游性能。此外,本文进一步引入测试时对多个变换输入的特征平均方法,在CIFAR-10/100和一种新型Spirograph数据集上实现了最先进性能,通过增强分布偏移下的不变性与泛化能力实现突破。
We propose methods to strengthen the invariance properties of representations obtained by contrastive learning. While existing approaches implicitly induce a degree of invariance as representations are learned, we look to more directly enforce invariance in the encoding process. To this end, we first introduce a training objective for contrastive learning that uses a novel regularizer to control how the representation changes under transformation. We show that representations trained with this objective perform better on downstream tasks and are more robust to the introduction of nuisance transformations at test time. Second, we propose a change to how test time representations are generated by introducing a feature averaging approach that combines encodings from multiple transformations of the original input, finding that this leads to across the board performance gains. Finally, we introduce the novel Spirograph dataset to explore our ideas in the context of a differentiable generative process with multiple downstream tasks, showing that our techniques for learning invariance are highly beneficial.
研究动机与目标
- 通过在训练过程中显式强制实现不变性,提升对比表示学习中的变换不变性。
- 解决传统测试时表示方法依赖未变换输入、无法聚合多视图信息的局限性。
- 开发一种在保留语义信息的同时消除干扰变换的方法,提升模型鲁棒性与泛化能力。
- 在多样化基准上验证该方法,包括一种新型可微生成数据集(Spirograph),以评估不变性与下游任务性能。
- 在训练-测试分布偏移条件下展示性能提升,并降低从学习表示中恢复变换参数的能力。
提出的方法
- 在对比损失中引入一种新颖的梯度正则化项,约束编码器输出在连续变换下变化缓慢,从而促进不变性。
- 采用可微变换过程生成具有可控干扰因子的数据,实现对不变性的精确分析。
- 提出测试时特征平均方法:对同一输入的多个变换视图进行编码,并对其表示进行平均,以提升不变性。
- 使用标准对比学习目标训练编码器,同时在损失中加入梯度正则化项,保持核心对比损失不变。
- 通过线性评估协议与生成参数回归评估性能,以衡量不变性与下游实用性。
- 设计Spirograph数据集为一种完全可微的生成过程,包含多个可控因子,支持对不变性的受控研究。
实验结果
研究问题
- RQ1显式梯度正则化是否能超越数据增强带来的隐式不变性,显著提升对比表示的不变性?
- RQ2与使用未变换输入的标准推理相比,测试时特征平均是否能带来更鲁棒、更不变的表示?
- RQ3在测试时分布偏移下,特别是当干扰变换与训练分布不一致时,所提方法表现如何?
- RQ4学习到的表示在多大程度上能抵抗变换参数的恢复,从而体现更强的不变性?
- RQ5所提方法是否能泛化到具有多个下游任务的复杂可微生成过程?
主要发现
- 梯度正则化显著降低了从表示中恢复变换参数的能力,Spirograph数据集上$f_r$的测试MSE从0.0000232降至0.0000028。
- 在CIFAR-100上,采用正则化的模型在所有测试的色彩失真方差缩放设置下均优于标准对比学习,表现出更强的鲁棒性。
- 测试时特征平均在所有下游任务与数据集上均带来一致的性能提升,具有理论与实证支持,可提升线性评估准确率。
- 在Spirograph数据集上,梯度正则化使所有生成参数的测试MSE均下降:$m$从0.0006773降至0.0005073,$b$从0.0112480降至0.0073607,$\sigma$从0.0000914降至0.0000527,$f_r$从0.0000232降至0.0000028。
- 在Spirograph数据集上,面对均值偏移与方差增加的分布偏移,所提方法保持优越性能,证明其对测试时分布偏移具有鲁棒性。
- 训练时采用梯度正则化、测试时采用特征平均的组合方法,在标准基准上达到最先进性能,并在可微生成设置中实现有效的表示学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。