[论文解读] Representation Uncertainty in Self-Supervised Learning as Variational Inference
本文提出 VI-SimSiam,一种新颖的自监督学习方法,将 SimSiam 框架化为在幂球状潜在空间上的变分推断,从而在无标签的情况下实现不确定性感知的表征学习。通过概率化建模表征,VI-SimSiam 同时预测特征与不确定性(通过浓度参数 κ 表示),在保持竞争力准确率的同时,定性地将较低的 κ 与模糊或显著性较低的图像关联起来。
In this study, a novel self-supervised learning (SSL) method is proposed, which considers SSL in terms of variational inference to learn not only representation but also representation uncertainties. SSL is a method of learning representations without labels by maximizing the similarity between image representations of different augmented views of an image. Meanwhile, variational autoencoder (VAE) is an unsupervised representation learning method that trains a probabilistic generative model with variational inference. Both VAE and SSL can learn representations without labels, but their relationship has not been investigated in the past. Herein, the theoretical relationship between SSL and variational inference has been clarified. Furthermore, a novel method, namely variational inference SimSiam (VI-SimSiam), has been proposed. VI-SimSiam can predict the representation uncertainty by interpreting SimSiam with variational inference and defining the latent space distribution. The present experiments qualitatively show that VI- SimSiam could learn uncertainty by comparing input images and predicted uncertainties. Additionally, we described a relationship between estimated uncertainty and classification accuracy.
研究动机与目标
- 建立自监督学习(SSL)与变分推断之间的理论联系,特别是针对 SimSiam 等非对比性 SSL 方法。
- 开发一种方法,在自监督设置下不仅学习表征,还学习其不确定性,以弥补现有 SSL 框架中缺乏不确定性估计的不足。
- 证明不确定性估计(κ)与下游分类准确率以及图像显著性之间存在关联,从而增强模型的可解释性。
- 在统一的变分推断框架下整合 SimSiam、SimCLR 和 DINO,揭示其潜在的概率结构。
提出的方法
- 通过将潜在表征建模为幂球分布,将 SimSiam 解释为变分推断,从而通过浓度参数 κ 实现不确定性估计。
- 将 SSL 目标函数形式化为证据下界(ELBO),包含三个组成部分:对齐项(J_align)、均匀性项(J_uniform)和 KL 散度项(J_KL),用于正则化后验分布。
- 后验分布 p(z|x,θ) 建模为单模态后验的专家产品(PoE),而近似后验 q(z|x,φ) 建模为专家混合(MoE),以实现多增强数据上的一致性。
- 通过幂球分布的浓度参数 κ 编码表征不确定性,该参数在训练过程中与表征联合优化。
- 采用幂球分布对数归一化常数的可微分近似,以支持端到端训练。
- 该框架可泛化现有 SSL 方法:SimSiam 作为在超球面上具有均匀先验的确定性输出,SimCLR 作为类别输出,DINO 作为具有动量编码器的确定性变体。
实验结果
研究问题
- RQ1像 SimSiam 这类自监督学习方法能否通过变分推断的视角进行解释?
- RQ2在无标签的自监督设置下,如何显式建模并预测表征不确定性?
- RQ3估计的不确定性(κ)与模型下游分类性能之间存在何种关系?
- RQ4潜在空间分布(如幂球分布、冯-米塞斯-费舍尔分布)如何在统一的概率框架下统一不同 SSL 目标函数?
主要发现
- VI-SimSiam 在无标签条件下成功学习表征不确定性,较低的不确定性(较高的 κ)对应于更具显著性或结构更清晰的图像。
- 不确定性参数 κ 与图像内容存在定性关联:显著性较低或特征模糊的图像表现出更低的 κ 值,表明不确定性更高。
- 该方法在 ImageNet-1K 上实现了与标准 SimSiam 相当的线性评估准确率,表明不确定性学习不会损害性能。
- 观察到估计不确定性(κ)与分类准确率之间存在正相关关系,表明更高的不确定性预测与更自信、更准确的预测相关。
- 理论框架将 SimSiam、SimCLR 和 DINO 统一为不同潜在分布上的变分推断特例,VI-SimSiam 将 SimSiam 扩展为包含不确定性估计的版本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。