[论文解读] Patched Denoising Diffusion Models For High-Resolution Image Synthesis
Patch-DM 提出了一种基于图像块的去噪扩散模型,用于高分辨率图像生成(例如 1024×512),通过在小尺寸 64×64 图像块上进行训练实现。该方法引入了一种新颖的特征拼接策略,通过裁剪并组合相邻偏移图像块的特征,有效消除边界伪影,从而在降低内存复杂度的同时实现当前最优的 FID 分数。
We propose an effective denoising diffusion model for generating high-resolution images (e.g., 1024$ imes$512), trained on small-size image patches (e.g., 64$ imes$64). We name our algorithm Patch-DM, in which a new feature collage strategy is designed to avoid the boundary artifact when synthesizing large-size images. Feature collage systematically crops and combines partial features of the neighboring patches to predict the features of a shifted image patch, allowing the seamless generation of the entire image due to the overlap in the patch feature space. Patch-DM produces high-quality image synthesis results on our newly collected dataset of nature images (1024$ imes$512), as well as on standard benchmarks of smaller sizes (256$ imes$256), including LSUN-Bedroom, LSUN-Church, and FFHQ. We compare our method with previous patch-based generation methods and achieve state-of-the-art FID scores on all four datasets. Further, Patch-DM also reduces memory complexity compared to the classic diffusion models.
研究动机与目标
- 解决高分辨率扩散模型训练过程中内存与计算成本过高的挑战。
- 克服基于图像块生成中因块边界导致的伪影问题,从而提升图像质量。
- 实现无需超分辨率后处理或潜在空间优化的直接高分辨率图像生成。
- 设计一种轻量化、紧凑的模型,确保图像块之间全局连贯性与局部一致性。
- 通过极简参数架构,在高分辨率与标准基准测试中均实现当前最优性能。
提出的方法
- 在小尺寸图像块(例如 64×64)上训练去噪扩散模型,而非全分辨率图像,以降低模型复杂度。
- 提出一种特征拼接策略,利用重叠相邻图像块的部分特征,预测偏移后图像块的特征。
- 采用滑动窗口机制生成位置偏移的图像块,实现图像块边界处的特征共享与一致性。
- 引入全局语义条件与可学习位置嵌入,以引导语义连贯性与空间对齐。
- 推理时按窗口偏移序列生成图像块,每个图像块的特征通过特征拼接从上下文相邻图像块中提取。
- 通过利用相邻图像块的上下文感知能力,将模型应用于图像生成与零样本图像修复任务。
实验结果
研究问题
- RQ1基于图像块的扩散模型是否能在无需超分辨率或潜在空间优化的前提下,实现高质量、无伪影的高分辨率图像生成?
- RQ2如何有效建模相邻图像块之间的特征共享,以消除基于图像块生成中的边界伪影?
- RQ3在基于图像块的扩散模型中,哪些组件对于维持全局语义一致性和局部结构连贯性至关重要?
- RQ4相较于像素级偏移或固定图像块生成,特征级窗口偏移在图像质量方面优势有多大?
- RQ5所提出方法是否能无需微调即泛化至零样本图像修复任务,通过周围图像块的上下文感知能力实现?
主要发现
- Patch-DM 在 LSUN-Church 数据集(1000 个样本)上实现了当前最优的 FID 得分 37.99,优于以往基于图像块的方法。
- 消融实验表明,全局语义条件与位置嵌入至关重要,若省略则 FID 分别上升至 79.33 与 48.82。
- 与像素空间偏移相比,采用拼接策略的特征级窗口偏移显著减少了边界伪影,FID 分数(固定 49.80,随机 52.11)优于本方法的 37.99。
- 该模型仅使用 148M 参数,即可在新收集的自然图像数据集上生成高质量的 1024×512 图像,展现出强大的可扩展性。
- Patch-DM 通过利用周围图像块的上下文特征,实现零样本图像修复,无需微调即可一致地恢复被遮挡区域。
- 特征拼接机制通过重叠且偏移的图像块生成方式,确保特征一致性,从而实现图像块间的无缝图像合成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。