Skip to main content
QUICK REVIEW

[论文解读] Biphasic Learning of GANs for High-Resolution Image-to-Image Translation

Jie Cao, Huaibo Huang|arXiv (Cornell University)|Apr 14, 2019
Generative Adversarial Networks and Image Synthesis参考文献 42被引用 5
一句话总结

本文提出了一种新型的GAN训练框架——双相学习(biphasic learning),通过将训练过程解耦为初始的低分辨率对抗训练阶段,随后进行高分辨率增强阶段(结合知识蒸馏与感知一致性正则化),显著提升了高分辨率图像到图像翻译的性能。该方法在1024²分辨率下实现了最先进(SOTA)的性能,无论在视觉质量还是训练稳定性方面均显著优于先前方法。

ABSTRACT

Despite that the performance of image-to-image translation has been significantly improved by recent progress in generative models, current methods still suffer from severe degradation in training stability and sample quality when applied to the high-resolution situation. In this work, we present a novel training framework for GANs, namely biphasic learning, to achieve image-to-image translation in multiple visual domains at $1024^2$ resolution. Our core idea is to design an adjustable objective function that varies across training phases. Within the biphasic learning framework, we propose a novel inherited adversarial loss to achieve the enhancement of model capacity and stabilize the training phase transition. Furthermore, we introduce a perceptual-level consistency loss through mutual information estimation and maximization. To verify the superiority of the proposed method, we apply it to a wide range of face-related synthesis tasks and conduct experiments on multiple large-scale datasets. Through comprehensive quantitative analyses, we demonstrate that our method significantly outperforms existing methods.

研究动机与目标

  • 为解决将GAN应用于高分辨率图像到图像翻译时训练稳定性与样本质量严重下降的问题。
  • 开发一种可在1024²分辨率下实现稳定且高效对抗学习的训练框架。
  • 在不依赖成对训练数据的前提下,提升翻译结果的视觉真实感与语义一致性。
  • 通过知识蒸馏与感知层级监督,增强模型容量与泛化能力。

提出的方法

  • 该框架将训练分为两个阶段:首先进行初始的低分辨率对抗训练,随后进入高分辨率增强阶段。
  • 引入继承的对抗损失,通过蒸馏将初始判别器的知识传递至增强后的生成器与判别器。
  • 在初始阶段训练的辅助判别器被固定,并在增强阶段重新用作监督头。
  • 设计了一种基于预训练神经估计器的互信息感知一致性正则化,以最大化源图像与翻译图像之间的感知相似性。
  • 损失函数在各阶段自适应更新,增强阶段以感知级监督替代像素级损失。
  • 该方法在无监督设置下运行,避免对成对数据的依赖,同时保持身份与属性一致性。

实验结果

研究问题

  • RQ1两阶段训练策略是否能稳定GAN训练并在1024²分辨率下提升样本质量?
  • RQ2如何有效将低分辨率判别器的知识迁移至高分辨率生成任务?
  • RQ3在无成对数据条件下,通过特征间互信息估计能否提升感知一致性?
  • RQ4结合蒸馏与感知正则化是否能带来优于标准GAN损失的视觉真实感?
  • RQ5该框架能否在多样化的面部相关翻译任务(如正面化与属性迁移)中实现良好泛化?

主要发现

  • BiL-GAN在Multi-PIE数据集上,于±15°姿态变化下实现99.96%的顶级识别率,优于所有先前方法。
  • 在同一数据集中,其在±60°下的识别率达到99.90%,显著优于次佳方法HF-PIM(99.1%)。
  • 在RaFD数据集的面部动画任务中,BiL-GAN在±15°下实现99.96%的识别率,超越此前最先进方法HF-PIM(99.9%)。
  • 消融实验表明,若移除互感知信息损失,性能显著下降,证实其关键作用。
  • 该方法在1024²分辨率下生成了视觉真实、高保真度的结果,相比CycleGAN及其他SOTA方法,纹理细节更丰富,身份保持更佳。
  • 该框架在阶段转换过程中保持训练稳定,即使在高分辨率下也未出现模式崩溃现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。