Skip to main content
QUICK REVIEW

[论文解读] IAN: Combining Generative Adversarial Networks for Imaginative Face Generation

Abdullah Hamdi, Bernard Ghanem|arXiv (Cornell University)|Apr 16, 2019
Generative Adversarial Networks and Image Synthesis参考文献 40被引用 5
一句话总结

本文提出 IAN(想象对抗网络),一种级联 GAN 框架,结合了 K-最近邻(K-NN)正则化 GAN(K-GAN)与 CycleGAN,通过融合基础数据集 X(例如,人脸)和目标数据集 Y(例如,动物脸)的特征,生成逼真且富有想象力的人脸图像。K-GAN 正则器在高层特征空间中强制执行特征匹配,实现对新颖、混合人脸身份的稳定、多样化生成,同时保持真实感,并支持多领域流形遍历和角色设计等应用。

ABSTRACT

Generative Adversarial Networks (GANs) have gained momentum for their ability to model image distributions. They learn to emulate the training set and that enables sampling from that domain and using the knowledge learned for useful applications. Several methods proposed enhancing GANs, including regularizing the loss with some feature matching. We seek to push GANs beyond the data in the training and try to explore unseen territory in the image manifold. We first propose a new regularizer for GAN based on K-nearest neighbor (K-NN) selective feature matching to a target set Y in high-level feature space, during the adversarial training of GAN on the base set X, and we call this novel model K-GAN. We show that minimizing the added term follows from cross-entropy minimization between the distributions of GAN and the set Y. Then, We introduce a cascaded framework for GANs that try to address the task of imagining a new distribution that combines the base set X and target set Y by cascading sampling GANs with translation GANs, and we dub the cascade of such GANs as the Imaginative Adversarial Network (IAN). We conduct an objective and subjective evaluation for different IAN setups in the addressed task and show some useful applications for these IANs, like manifold traversing and creative face generation for characters' design in movies or video games.

研究动机与目标

  • 通过探索图像流形中未被探索的区域,使 GAN 能够生成超越训练数据分布的新颖、逼真图像。
  • 解决标准 GAN 在记忆训练数据方面存在的局限性,并在面对未见的混合图像分布时无法泛化的问题。
  • 开发一种稳定且具有数学基础的正则器,引导 GAN 向目标域 Y 的特征靠拢,同时保持基础分布 X 的特性。
  • 构建一种级联 GAN 框架(IAN),结合采样 GAN 与图像到图像的转换,用于富有想象力的人脸生成。
  • 在创意设计等实际应用中展示其潜力,例如生成类人-动物角色以及多领域流形遍历。

提出的方法

  • 提出 K-GAN,一种新颖的 GAN 正则器,利用预训练 ImageNet 分类器提取的高层特征空间中的 K-NN 选择,实现生成图像与目标集 Y 的特征匹配。
  • 引入一种级联框架,其中采样 GAN(如 K-GAN 或 BEGAN)从基础集 X 生成图像,随后通过 CycleGAN 将其翻译至目标域 Y。
  • 使用预训练 AlexNet 提取的特征嵌入在高维空间中计算 K-NN 匹配,确保特征匹配的稳定性和意义性。
  • 采用源自 BEGAN 判别器的自编码器架构,对潜在向量进行编码与解码,以支持流形遍历。
  • 在 CycleGAN 中应用循环一致性损失,确保从 X 到 Y 的图像翻译过程中结构与身份的保留。
  • 将级联系统的输出相结合,生成融合 X 和 Y 两者属性的混合人脸图像,同时保持真实感。

实验结果

研究问题

  • RQ1基于 K-NN 的特征匹配正则器是否能稳定 GAN 训练,并在不损害基础分布 X 的前提下,引导生成结果向目标域 Y 靠拢?
  • RQ2将采样 GAN 与 CycleGAN 级联是否能实现对新颖、逼真、富有想象力的人脸图像的合成,使其融合两个不同领域特征?
  • RQ3与原始 GAN 及未正则化的级联 GAN 相比,所提出的 IAN 框架在图像真实感和人类偏好方面表现如何?
  • RQ4IAN 框架是否仅使用两个基础样本即可支持多领域流形遍历?
  • RQ5IAN 在电影与电子游戏等创意应用(如角色设计)中的适用程度如何?

主要发现

  • K-GAN 正则器通过最小化 GAN 输出分布与目标集 Y 在特征空间中的交叉熵,显著提升了生成图像的稳定性和质量。
  • 将 K-GAN 与 CycleGAN 级联后,目标域 Y 的 Inception 准确率提升 40%,喜爱度评分提升 15%,相比未正则化的 IAN。
  • 尽管在人类偏好上有时更倾向未正则化的 IAN,K-GAN 在 Inception 网络得分和人类评估指标上始终优于标准 GAN。
  • 该框架支持多领域流形遍历:通过插值两个基础图像的潜在码,系统可仅用一对基础样本,在多个目标域(如从人类到狗、猫、马)之间生成平滑过渡。
  • IAN 框架成功生成了合理且富有想象力的类人-动物角色人脸,证明其在电影与电子游戏等创意设计中的实用性。
  • 若放弃正则器,将导致高频伪影和 CycleGAN 中的误差放大,证实 K-NN 特征匹配对系统稳定性至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。