[论文解读] Denoising Diffusion Autoencoders are Unified Self-supervised Learners
该论文表明,为无条件图像生成预训练的去噪扩散自编码器(DDA)在其中间层中固有地学习到高度线性可分的表征,使其能够作为生成与判别任务的统一自监督学习器。无需辅助编码器,DDA在CIFAR-10上实现95.9%的线性探测准确率,在Tiny-ImageNet上实现50.0%,与当前最优的对比学习和掩码自编码方法相当。
Inspired by recent advances in diffusion models, which are reminiscent of denoising autoencoders, we investigate whether they can acquire discriminative representations for classification via generative pre-training. This paper shows that the networks in diffusion models, namely denoising diffusion autoencoders (DDAE), are unified self-supervised learners: by pre-training on unconditional image generation, DDAE has already learned strongly linear-separable representations within its intermediate layers without auxiliary encoders, thus making diffusion pre-training emerge as a general approach for generative-and-discriminative dual learning. To validate this, we conduct linear probe and fine-tuning evaluations. Our diffusion-based approach achieves 95.9% and 50.0% linear evaluation accuracies on CIFAR-10 and Tiny-ImageNet, respectively, and is comparable to contrastive learning and masked autoencoders for the first time. Transfer learning from ImageNet also confirms the suitability of DDAE for Vision Transformers, suggesting the potential to scale DDAEs as unified foundation models. Code is available at github.com/FutureXiang/ddae.
研究动机与目标
- 探究扩散模型是否可作为生成与识别任务的统一自监督学习器。
- 评估去噪扩散自编码器(DDA)是否仅通过生成预训练即可学习判别性表征。
- 在线性探测与微调设置下,对比DDAE与对比学习和掩码自编码器的性能。
- 评估DDAE在视觉Transformer和大规模数据集(如ImageNet)上的可扩展性与迁移能力。
- 探究扩散模型中固有的去噪过程是否隐式支持判别性表征学习。
提出的方法
- 使用逐步向图像添加噪声并学习反向过程的噪声调度方案,在无条件图像生成任务上预训练一个去噪扩散自编码器(DDA)。
- 在去噪过程中提取DDA编码器的中间特征,并通过线性探测评估其判别质量。
- 根据探测结果确定最佳性能层,截断DDA编码器并微调所得模型以进行图像分类。
- 在CIFAR-10和Tiny-ImageNet上,通过线性探测和微调协议,将DDAE性能与对比学习(SimCLR)和掩码自编码器(MAE)进行比较。
- 使用在ImageNet上训练的类别条件DDAE变体,以无条件方式评估其迁移学习潜力。
- 应用基于度量的层选择方法,识别出无需额外监督的最具判别性的中间表征。
实验结果
研究问题
- RQ1仅通过无条件图像生成任务预训练的扩散模型,是否能在其中间层中学习到强判别性表征,而无需辅助监督或显式对比目标?
- RQ2在CIFAR-10和Tiny-ImageNet等标准基准上,基于DDAE的自监督表征学习性能与当前最优的对比学习和掩码自编码方法相比如何?
- RQ3DDAE的中间特征空间是否具备足够的线性与可分性,以支持有效的线性探测与微调用于图像分类?
- RQ4DDAE是否可有效迁移至视觉Transformer并扩展至ImageNet等大规模数据集,表明其作为统一基础模型的潜力?
- RQ5扩散模型中去噪过程与判别性特征涌现之间的关系是什么?与对比学习或掩码建模方法相比有何异同?
主要发现
- 在无条件图像生成任务上进行DDA预训练,可得到高度线性可分的中间特征,无需任何额外训练即可在线性探测评估中实现优异性能。
- 在CIFAR-10上,DDAE实现95.9%的线性探测准确率,与或超过当前最优的对比学习和掩码自编码方法。
- 在Tiny-ImageNet上,DDAE实现50.0%的线性探测准确率,尽管数据集复杂,仍表现出竞争力。
- 对截断的DDAE编码器进行微调后,在CIFAR-10上达到97.2%的准确率,在Tiny-ImageNet上达到69.4%,表明其在分类任务中具有强大的迁移能力。
- 在ImageNet上微调后,基于DDAE的模型在CIFAR-10上达到98.1%的准确率,在Tiny-ImageNet上达到77.8%,证实其在迁移学习中的可扩展性与有效性。
- DDAE的性能与MAE和SimCLR相当,表明基于扩散的预训练可作为生成与判别学习的统一替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。