[论文解读] Diffusion-Based Representation Learning
本文提出了基于扩散的表征学习(DRL),一种新颖的无监督表征学习框架,通过重新表述去噪得分匹配,实现对学习表征细节程度的手动控制。通过将得分匹配目标条件化于无限维潜在码,DRL 在半监督图像分类任务中达到最先进性能,并实现更快采样而无质量损失,在下游任务中优于先前方法。
Diffusion-based methods represented as stochastic differential equations on a continuous-time domain have recently proven successful as a non-adversarial generative model. Training such models relies on denoising score matching, which can be seen as multi-scale denoising autoencoders. Here, we augment the denoising score matching framework to enable representation learning without any supervised signal. GANs and VAEs learn representations by directly transforming latent codes to data samples. In contrast, the introduced diffusion-based representation learning relies on a new formulation of the denoising score matching objective and thus encodes the information needed for denoising. We illustrate how this difference allows for manual control of the level of details encoded in the representation. Using the same approach, we propose to learn an infinite-dimensional latent code that achieves improvements of state-of-the-art models on semi-supervised image classification. We also compare the quality of learned representations of diffusion score matching with other methods like autoencoder and contrastively trained systems through their performances on downstream tasks.
研究动机与目标
- 开发一种不依赖监督信号或数据增强的扩散模型中的表征学习框架。
- 通过调整扩散过程中噪声尺度,实现对表征中编码细节程度的手动控制。
- 使用学习到的表征作为预训练方法,提升下游半监督图像分类任务的性能。
- 通过优化初始噪声尺度,解决扩散模型中采样速度慢的瓶颈问题。
- 提供一种理论坚实的信息论替代方案,替代对比学习,避免依赖领域特定的数据增强不变性。
提出的方法
- 将去噪得分匹配重新表述为条件目标,其中得分估计器基于干净数据 x₀ 的潜在码 z 条件化。
- 引入无限维潜在码以捕捉高保真、细粒度的特征,从而在下游任务中提升泛化能力。
- 使用与生成建模相同的得分匹配损失,但将其条件化于潜在表征,以确保损失可被驱动至任意接近零。
- 采用连续时间随机微分方程(SDE)框架进行前向扩散过程,反向过程通过得分匹配学习。
- 通过使用均匀分布与高斯先验的和,优化初始噪声尺度 t_init,使采样步数减少高达30%,同时保持图像质量。
- 训练编码器从干净数据中提取特征,而非噪声输入,从而基于噪声水平实现对特征粒度的显式控制。
实验结果
研究问题
- RQ1去噪得分匹配能否被重新表述为一种无需数据增强或监督信号的无监督表征学习方法?
- RQ2在基于扩散的框架中,如何实现对学习表征细节程度的手动控制?
- RQ3无限维潜在码能否提升下游任务(如少样本分类)的性能?
- RQ4优化扩散过程中初始噪声尺度是否能减少采样时间而不降低图像质量?
- RQ5与对比学习和自编码器方法相比,所提出的 DRL 方法在表征质量和泛化能力方面表现如何?
主要发现
- 所提出的 DRL 框架实现了对表征粒度的手动控制:较高噪声水平编码粗粒度特征,而较低噪声水平则捕捉如笔画宽度等细粒度细节。
- 无限维潜在码显著提升了半监督图像分类任务的性能,在作为预训练方法时超越了 SOTA 模型(如 LaplaceNet)。
- 通过将初始噪声尺度 t_init 设为 0.7,采样步数可减少 30% 而不损失图像质量,FID 分数与视觉质量均得到验证。
- 在 t_init ≈ 0.7 时使用均匀与高斯噪声的和作为先验,相比标准先验,可提升图像质量,表明对真实数据分布的逼近更优。
- 通过学习到的表征,DRL 损失可被驱动至任意接近零,而此前方法无法实现,为编码器中的信息通道提供了理论基础。
- 该方法在下游任务中优于对比学习与自编码器方法,且优势在于无需领域特定的数据增强知识或网络架构修改。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。