Skip to main content
QUICK REVIEW

[论文解读] CoMoGAN: continuous model-guided image-to-image translation

Fabio Pizzati, Pietro Cerri|arXiv (Cornell University)|Mar 11, 2021
Generative Adversarial Networks and Image Synthesis参考文献 68被引用 4
一句话总结

CoMoGAN 提出了一种新颖的无监督图像到图像翻译框架,通过使用功能实例归一化(FIN)层和解缠残差块(DRB)将内容与流形位置解耦,学习连续的非线性域间转换。该方法借助简单的物理启发模型进行引导,同时允许发现目标域的私有特征,在循环和线性翻译任务上实现了最先进的FID和LPIPS得分,表现优于以往方法。

ABSTRACT

CoMoGAN is a continuous GAN relying on the unsupervised reorganization of the target data on a functional manifold. To that matter, we introduce a new Functional Instance Normalization layer and residual mechanism, which together disentangle image content from position on target manifold. We rely on naive physics-inspired models to guide the training while allowing private model/translations features. CoMoGAN can be used with any GAN backbone and allows new types of image translation, such as cyclic image translation like timelapse generation, or detached linear translation. On all datasets, it outperforms the literature. Our code is available at http://github.com/cv-rits/CoMoGAN .

研究动机与目标

  • 实现无中间域监督的无监督连续图像到图像翻译。
  • 将图像内容与功能流形上的位置解耦,以实现对时间流逝或天气变化等连续变换的控制。
  • 开发一种与模型无关的框架,无需标注中间点即可发现目标流形结构。
  • 通过学习偏离模型引导而非模仿它,提升图像翻译的泛化能力和多样性。

提出的方法

  • 引入功能实例归一化(FIN)层,通过学习潜在码的功能映射,实现对目标数据流形的连续重塑。
  • 采用解缠残差块(DRB),通过一种新颖的归一化与残差机制,将内容与流形位置(ϕ)分离。
  • 使用成对ϕ回归网络(ϕ-Net)通过估计生成输出与模型预测输出之间的距离,来强制保持流形一致性。
  • 优化两个关键损失:模型重建损失(ℒM)以对齐物理启发模型,以及流形一致性损失(ℒϕ)以保持流形上的结构关系。
  • 支持任意生成对抗网络(GAN)主干网络的端到端训练,适用于单模态和多模态翻译设置。
  • 通过ϕ-Net从输入估计ϕ,实现ϕ无关的推理,支持无需固定源条件的绝对和相对翻译。

实验结果

研究问题

  • RQ1是否可以在无需中间域监督或标注中间点的情况下,学习连续的非线性图像翻译?
  • RQ2如何将图像内容与流形位置(ϕ)解耦,以实现对时间流逝或天气变化等连续变换的控制?
  • RQ3能否通过简单的物理启发模型引导学习复杂且私有的目标特征,而无需强制模仿?
  • RQ4GAN在无监督地从混合源域和目标域数据中发现并重组功能流形方面,能力达到何种程度?
  • RQ5该框架是否能推广到源域和目标域未预先划分的真正无监督设置?

主要发现

  • CoMoGAN在循环(如时间流逝)和线性(如景深、雾天)图像翻译任务上均达到最先进性能,优于以往SOTA方法。
  • 在Day→Timelapse任务中,CoMoGAN在同时使用ℒM和ℒϕ损失时,LPIPS达到0.236,显著优于消融实验(无ℒM时为0.020,无ℒϕ时为0.044)。
  • 通过模型引导的解耦方法,CoMoGAN能够学习到专属的目标特征,FID更低(1.41),多样性更好;而模仿模型在增加模型权重时FID会发散。
  • 在缺乏黄昏/黎明数据的情况下,训练会严重失败,凸显对数据稀疏性的敏感性,尤其是对复杂流形结构而言。
  • ϕ无关推理支持绝对和相对翻译(如“任何时间 → 白天”或“+5°”),即使在夜间图像等挑战性输入上也表现出鲁棒性和泛化能力。
  • 该框架在真正无监督设置(如MNIST-M中存在域混淆)下成功学习了连续流形,无需固定源/目标划分即可生成有效翻译。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。