[论文解读] Self-supervised Representation Learning with Relative Predictive Coding
本文提出相对预测编码(RPC),一种新型对比表示学习目标,通过引入相对参数来正则化损失函数,消除导致不稳定的对数和指数项,从而提升训练稳定性,降低小批量大小的敏感性,并增强下游性能。RPC 在视觉和语音基准测试中实现了最先进性能,方差更低,且在不同数据集上表现一致。
This paper introduces Relative Predictive Coding (RPC), a new contrastive representation learning objective that maintains a good balance among training stability, minibatch size sensitivity, and downstream task performance. The key to the success of RPC is two-fold. First, RPC introduces the relative parameters to regularize the objective for boundedness and low variance. Second, RPC contains no logarithm and exponential score functions, which are the main cause of training instability in prior contrastive objectives. We empirically verify the effectiveness of RPC on benchmark vision and speech self-supervised learning tasks. Lastly, we relate RPC with mutual information (MI) estimation, showing RPC can be used to estimate MI with low variance.
研究动机与目标
- 为解决对比自监督学习中的训练不稳定性,特别是损失函数方差过高的问题。
- 降低对小批量大小的敏感性,这限制了需要大批次的对比方法的实际部署。
- 在保持训练稳定性和鲁棒性的前提下,提升下游任务性能。
- 开发一种避免对数和指数运算的对比目标,因为这些运算被公认为数值不稳定的根源。
- 建立 RPC 与低方差互信息估计之间的联系。
提出的方法
- RPC 引入相对参数(α, β, γ)以正则化对比损失,确保其有界性并降低方差。
- 目标函数用二次项和线性项替代对数和指数项,从而提升数值稳定性。
- 核心损失定义为:J_RPC = -[f_k(h_{t+k}, c_t) - (α/|N|)Σf_k(h_i, c_t) - (β/2)f_k²(h_{t+k}, c_t) - (γ/(2|N|))Σf_k²(h_i, c_t)],其中 h 为表示,c 为上下文。
- 相对参数起到 ℓ₂ 正则化作用,稳定优化景观并防止极端值出现。
- 视觉和语音任务均使用温度 τ=16,且不进行隐藏层归一化,以保留原始损失动态。
- RPC 在 CIFAR-10/100、STL-10、ImageNet 和 LibriSpeech 上进行了实证验证,采用 ResNet-18 及先前工作的模型。
实验结果
研究问题
- RQ1能否设计一种对比学习目标,在保持训练稳定性的同时实现高下游性能?
- RQ2在损失函数中移除对数和指数项是否能降低训练方差并提升稳定性?
- RQ3与先前的对比目标相比,所提出方法对小批量大小的敏感性如何?
- RQ4RPC 是否可用于实现低方差的互信息估计?
- RQ5相对参数(α, β, γ)的最优配置是什么,以实现稳定且准确的 MI 估计?
主要发现
- 与 DV、NWJ 和 CPC 相比,RPC 的训练方差更低,尤其是在不使用隐藏归一化时,表明其稳定性得到改善。
- RPC 对小批量大小的敏感性降低,在小批量设置下仍能保持强性能,而 CPC 则需要大批次才能表现良好。
- 在 CIFAR-10 上,RPC 使用 ResNet-18 达到 93.8% 的 top-1 准确率,优于 CPC 并接近全监督性能。
- 在 ImageNet 上,RPC 在线性评估中达到 76.5% 的 top-1 准确率,展现出强大的迁移能力。
- 当 β ≈ 10⁻³ 且 γ ≈ 1.0 时,RPC 能够以低偏差和低方差估计互信息,优于 DoE 在低互信息场景下的表现。
- 在 20 维相关高斯分布上的互信息估计中,RPC 在 β=10⁻³ 且 γ=1.0 时可提供稳定且准确的估计,而 DoE 在互信息较小时变得不稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。