[论文解读] SinDDM: A Single Image Denoising Diffusion Model
SinDDM 提出了一种单图像去噪扩散模型,通过利用多尺度扩散过程和一种基于噪声级别与尺度的轻量化全卷积去噪器,在仅使用一张图像的情况下进行训练。该方法可在任意分辨率下实现高质量、多样化的图像生成,并通过 CLIP 支持文本引导的编辑,且无需微调或架构修改。
Denoising diffusion models (DDMs) have led to staggering performance leaps in image generation, editing and restoration. However, existing DDMs use very large datasets for training. Here, we introduce a framework for training a DDM on a single image. Our method, which we coin SinDDM, learns the internal statistics of the training image by using a multi-scale diffusion process. To drive the reverse diffusion process, we use a fully-convolutional light-weight denoiser, which is conditioned on both the noise level and the scale. This architecture allows generating samples of arbitrary dimensions, in a coarse-to-fine manner. As we illustrate, SinDDM generates diverse high-quality samples, and is applicable in a wide array of tasks, including style transfer and harmonization. Furthermore, it can be easily guided by external supervision. Particularly, we demonstrate text-guided generation from a single image using a pre-trained CLIP model.
研究动机与目标
- 开发一种能够从单张图像学习而无需大规模数据集的生成模型。
- 通过利用图像内部的多尺度统计特性,克服扩散模型在数据稀缺情况下的限制,实现在单张图像上的训练。
- 通过自粗到精的采样方式,实现在任意分辨率下的多样化、高保真图像生成。
- 通过预训练模型实现灵活的图像操作,包括无需微调的文本引导内容与风格编辑。
- 在保持样本多样性与真实感的同时,保留源图像的结构与纹理一致性。
提出的方法
- 通过在每个尺度上使用训练图像的下采样和模糊版本,构建多尺度前向扩散过程。
- 训练一个轻量化全卷积去噪器,以在每个尺度上逆转扩散过程,且条件依赖于噪声水平和尺度。
- 反向过程以自粗到精的方式进行:在最粗尺度上逐步去除噪声,然后上采样并重新组合噪声,进入下一更精细的尺度。
- 去噪器使用较小的感受野以建模细粒度的局部统计特性,从而实现对纹理和小结构的真实感合成。
- 通过使用预训练的 CLIP 模型,基于特征损失引导采样过程,实现文本引导的生成,且不修改模型架构。
- 采样多样性受填充策略影响,其中逐层零填充可减少边界区域的变异性,而仅在初始输入处填充则会增加其变异性。
实验结果
研究问题
- RQ1能否仅利用图像内部统计特性,有效训练一个在单张图像上进行去噪扩散的模型?
- RQ2如何使扩散模型在仅基于单张图像的情况下,生成多样化且高质量的图像,且支持任意分辨率?
- RQ3单图像扩散模型在不进行微调的情况下,能在多大程度上支持文本引导的图像生成?
- RQ4多尺度架构在多大程度上有助于在生成样本中同时保留全局结构与细节?
- RQ5在训练图像中,稀有或代表性不足的物体存在哪些表示局限性?如何缓解这些问题?
主要发现
- SinDDM 可在任意分辨率下生成多样化、高保真的图像,包括原始图像中不存在的大规模结构和细节的新型组合。
- 该模型成功通过 CLIP 实现文本引导的图像生成,支持内容与风格编辑,且无需微调或架构更改。
- SinDDM 在风格迁移与融合任务中优于 SinIR 和 ConSinGAN,生成结果更具一致性与自然融合感。
- 即使原始图像中不存在,模型仍能生成训练图像的真实变体,例如新的天际线布局或山体角度。
- 局限性包括某些物体(如大象或鸟类)的过量或不足表示,可通过手动调整初始时间步长缓解,但尚未实现自动化。
- 填充配置显著影响图像边界区域的采样多样性,其中逐层零填充可减少边界变异性,而仅在初始输入处填充则会增加其变异性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。