Skip to main content
QUICK REVIEW

[论文解读] Dual Diffusion Implicit Bridges for Image-to-Image Translation

Xuan Su, Jiaming Song|arXiv (Cornell University)|Mar 16, 2022
Generative Adversarial Networks and Image Synthesis被引用 13
一句话总结

本文提出双扩散隐式桥接(DDIBs),一种新颖的图像到图像翻译方法,通过使用两个独立训练的扩散模型(分别用于源域和目标域)实现训练解耦,从而在无需同时访问源域与目标域数据的情况下实现隐私保护的成对翻译。该方法利用概率流常微分方程(ODE)将图像映射至共享潜在空间并重建目标域图像,实现高达求解器离散化误差范围内的循环一致性,并在理论上将该过程形式化为通过Schrödinger桥实现的熵正则化最优传输。

ABSTRACT

Common image-to-image translation methods rely on joint training over data from both source and target domains. The training process requires concurrent access to both datasets, which hinders data separation and privacy protection; and existing models cannot be easily adapted for translation of new domain pairs. We present Dual Diffusion Implicit Bridges (DDIBs), an image translation method based on diffusion models, that circumvents training on domain pairs. Image translation with DDIBs relies on two diffusion models trained independently on each domain, and is a two-step process: DDIBs first obtain latent encodings for source images with the source diffusion model, and then decode such encodings using the target model to construct target images. Both steps are defined via ordinary differential equations (ODEs), thus the process is cycle consistent only up to discretization errors of the ODE solvers. Theoretically, we interpret DDIBs as concatenation of source to latent, and latent to target Schrodinger Bridges, a form of entropy-regularized optimal transport, to explain the efficacy of the method. Experimentally, we apply DDIBs on synthetic and high-resolution image datasets, to demonstrate their utility in a wide variety of translation tasks and their inherent optimal transport properties.

研究动机与目标

  • 解决现有无配对图像翻译方法依赖于源域与目标域数据联合训练的局限性。
  • 通过消除训练期间对源域与目标域数据同时访问的需求,实现数据隐私保护。
  • 通过复用预训练的领域特定扩散模型于多个翻译任务,提升模型适应性。
  • 基于最优传输原理(特别是Schrödinger桥)提供一个理论基础坚实的图像翻译框架。
  • 证明DDIBs在无需领域特定微调的情况下,实现高质量翻译,具备内在的循环一致性与最优传输效率。

提出的方法

  • DDIBs使用两个独立的、预训练的扩散模型——一个用于源域,一个用于目标域——分别在各自的数据集上独立训练。
  • 该方法应用从源模型出发的前向概率流ODE,将源图像映射至潜在表征,同时保留内容结构。
  • 随后,从目标模型出发的反向概率流ODE利用该潜在代码重建目标域图像,完成翻译过程。
  • 整个过程由两个ODE定义:一个用于源到潜在空间的映射,另一个用于潜在空间到目标图像的重建,二者均源自去噪扩散隐式模型(DDIMs)。
  • 翻译过程被解释为两个Schrödinger桥问题的串联:源到潜在空间与潜在空间到目标,其漂移项为退化或线性形式,从而在最优传输理论中获得理论支撑。
  • 循环一致性在ODE求解器的数值离散化误差范围内实现,确保图像来回翻译后可恢复至原始图像,误差在求解器容差范围内。

实验结果

研究问题

  • RQ1是否可以在不联合使用源域与目标域配对数据的情况下实现图像到图像翻译,从而保护数据隐私?
  • RQ2如何在不重新训练的前提下,将领域特定的扩散模型复用于多个翻译任务?
  • RQ3DDIBs与最优传输之间存在何种理论联系,特别是与Schrödinger桥的关系?
  • RQ4DDIBs在多大程度上实现了循环一致性?这与ODE求解器的精度有何关联?
  • RQ5DDIBs能否在翻译质量上超越现有的基于GAN和流模型的方法,同时保持计算效率与隐私优势?

主要发现

  • DDIBs在合成数据集与高分辨率数据集上均实现了高质量的图像翻译,包括使用预训练的条件扩散模型实现从老虎到猫的图像翻译。
  • 该方法在ODE求解器离散化误差范围内展现出内在的循环一致性,图像来回翻译时性能退化极小。
  • DDIBs在理论上被证明是退化Schrödinger桥问题的解,将其与熵正则化最优传输联系起来,为基于最优传输的原理化方法提供了替代传统启发式损失最小化的新路径。
  • 该方法通过消除训练期间对源域与目标域数据并行访问的需求,实现了隐私保护的翻译。
  • DDIBs在适应性方面优于现有方法,仅需线性数量的模型(每个领域一个),而非二次方数量,显著降低了模型存储与训练开销。
  • 该方法在多样化翻译任务中表现强劲,包括风格迁移与图像恢复,其性能与最先进的联合训练方法相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。