[论文解读] Pretraining is All You Need for Image-to-Image Translation
本文展示了一个预训练的扩散模型可以作为多种图像到图像翻译任务的通用生成先验,通过任务特定的适配器和训练调整,在多个基准上取得了最先进的结果。
We propose to use pretraining to boost general image-to-image translation. Prior image-to-image translation methods usually need dedicated architectural design and train individual translation models from scratch, struggling for high-quality generation of complex scenes, especially when paired training data are not abundant. In this paper, we regard each image-to-image translation problem as a downstream task and introduce a simple and generic framework that adapts a pretrained diffusion model to accommodate various kinds of image-to-image translation. We also propose adversarial training to enhance the texture synthesis in the diffusion model training, in conjunction with normalized guidance sampling to improve the generation quality. We present extensive empirical comparison across various tasks on challenging benchmarks such as ADE20K, COCO-Stuff, and DIODE, showing the proposed pretraining-based image-to-image translation (PITI) is capable of synthesizing images of unprecedented realism and faithfulness.
研究动机与目标
- 激发并证明大规模预训练可以提升跨多种任务的条件图像合成。
- 利用一个预训练的扩散模型(GLIDE)作为下游翻译任务的语义潜在先验。
- 开发一个实用的两阶段微调协议,将输入条件映射到预训练的潜在空间。
- 通过对抗性扩散上采样器以及感知/对抗损失来提升生成质量。
- 提出归一化的 classifier-free 指导以提升条件保真度和样本质量。
提出的方法
- 将一个在多样文本-图像对上训练的生成式预训练扩散先验(GLIDE)用作解码器。
- 附加一个任务特定的编码器头,将输入(例如分割掩码、草图、深度图)映射到预训练潜在空间。
- 两阶段微调:(1)在保持解码器固定的情况下训练编码器;(2)端到端微调编码器和解码器。
- 在高分辨率生成阶段使用对抗性扩散上采样器,结合退化和感知/对抗损失以改善纹理。
- 引入归一化的 classifier-free 指导,以在条件采样过程中纠正均值/方差偏移,并在不造成饱和的情况下实现更强的引导。
- 采用分层生成设置,基于扩散的上采样从 64x64 的基础输出生成 256x256 图像。
实验结果
研究问题
- RQ1单个预训练扩散模型是否可以作为多种图像到图像翻译任务的通用先验?
- RQ2哪些训练策略(两阶段微调、对抗性上采样、感知/对抗损失)能最大化翻译质量?
- RQ3在标准基准(ADE20K、COCO-Stuff、DIODE)上,PITI 与任务特定或从零开始训练的基线相比如何?
- RQ4预训练是否在下游数据有限的情况下也能实现高质量结果(少样本情景)?
主要发现
- PITI 在跨任务和跨数据集上都显著优于从零开始训练的基线。
- 两阶段微调带来最佳结果,在保持预训练先验的同时实现语义对齐。
- 对抗性扩散上采样和感知/对抗损失显著提升高分辨率输出的纹理和细节。
- 归一化的 classifier-free 指导在强引导下提升样本质量,同时不引入有害的均值/方差偏移。
- 在 ADE20K、COCO-Stuff 和 DIODE 上,PITI 实现了类似于最先进方法的 FID 提升,超过了任务特定和从零开始的基线;表 1 中的结果显示了显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。