Skip to main content
QUICK REVIEW

[论文解读] DeepFace: Face Generation using Deep Learning

Hardie Cate, Fahim Dalvi|arXiv (Cornell University)|Jan 7, 2017
Face recognition and analysis参考文献 10被引用 6
一句话总结

本文提出了一种深度学习框架,结合微调的卷积神经网络(CNN)进行面部属性分类,以及一种自定义高斯混合模型(cGMM)以从指定属性生成逼真的面部图像。通过利用VGG-Face激活特征的特征反演,该方法在无需生成架构(除CNN外)的情况下生成连贯的面部图像,实现了82%的分类准确率,并生成与目标属性匹配的合理面部图像。

ABSTRACT

We use CNNs to build a system that both classifies images of faces based on a variety of different facial attributes and generates new faces given a set of desired facial characteristics. After introducing the problem and providing context in the first section, we discuss recent work related to image generation in Section 2. In Section 3, we describe the methods used to fine-tune our CNN and generate new images using a novel approach inspired by a Gaussian mixture model. In Section 4, we discuss our working dataset and describe our preprocessing steps and handling of facial attributes. Finally, in Sections 5, 6 and 7, we explain our experiments and results and conclude in the following section. Our classification system has 82\% test accuracy. Furthermore, our generation pipeline successfully creates well-formed faces.

研究动机与目标

  • 开发一种基于指定面部属性(如发色、种族和配饰)生成逼真面部图像的系统。
  • 使用微调的VGG-Face CNN对73种面部特征进行分类,实现在73种面部特征上的高准确率。
  • 通过基于新型cGMM方法的特征激活反演,从随机噪声生成新且结构良好的面部图像。
  • 证明基于CNN的系统可在无需生成对抗网络或变分自编码器的情况下生成合理面部图像。
  • 使用与测试集中真实图像的相似性度量,评估生成面部图像的质量。

提出的方法

  • 在包含200万张名人面部图像的数据集上微调预训练的VGG-Face CNN,在fc-7层附加42个多标签Softmax头,用于73种面部属性的分类。
  • 通过在50个周期内使用Dropout和5e-6的学习率对微调过程进行正则化,防止过拟合。
  • 将CNN中特征激活的分布建模为自定义高斯混合模型(cGMM),假设每种属性的激活呈正态分布且相互独立。
  • 通过使用cGMM的均值估计,将目标属性激活反投影到图像空间,从随机噪声开始进行特征反演。
  • 应用高斯均值的加权和以重建图像,优先考虑计算效率而非生成输出中的方差。
  • 使用PicTriev相似性度量,对测试集中真实图像与生成图像进行定量评估。

实验结果

研究问题

  • RQ1微调的CNN能否在分类如发色、种族和配饰等多样化面部属性方面实现高准确率?
  • RQ2自定义高斯混合模型能否有效反演CNN特征激活,从而从随机噪声生成连贯且逼真的面部图像?
  • RQ3生成的面部图像在感知上与真实图像的相似度如何,是否能与目标属性保持一致?
  • RQ4cGMM方法在保留区分性面部特征方面存在哪些局限性,特别是在处理不显著属性时?
  • RQ5若训练数据中属性多样性更高,该方法能否生成多样化且非均值中心化的面部图像?

主要发现

  • 分类系统的平均测试准确率达到82%,大多数单个属性的得分高于0.8,许多超过0.9。
  • 基于cGMM的生成流程成功地从随机噪声生成结构良好、连贯的面部图像,证明了特征反演的可行性。
  • 生成的面部图像与真实图像具有中等相似度,PicTriev度量下的相似性得分在22%(Mickey Rourke)至52%(Jared Leto)之间。
  • 光照和照片类型等属性的分类准确率较低(约55–60%),可能是因为这些属性在特征空间中区分度较低。
  • 生成的面部图像始终接近训练集的平均图像,表明由于高斯均值的平均化,生成结果的多样性有限。
  • 该方法的性能受限于假设特征激活相互独立且呈正态分布,这可能导致相关属性之间的区分度模糊化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。