Skip to main content
QUICK REVIEW

[论文解读] Deep Feature Consistent Variational Autoencoder

Xianxu Hou, Linlin Shen|arXiv (Cornell University)|Oct 2, 2016
Face recognition and analysis参考文献 32被引用 14
一句话总结

本文提出了一种深度特征一致变分自编码器(DFC-VAE),用基于预训练CNN的深层特征感知损失替代传统的逐像素重建损失,显著提升了图像生成质量和语义表征。该方法在使用学习到的潜在向量进行面部属性预测方面达到了最先进性能。

ABSTRACT

We present a novel method for constructing Variational Autoencoder (VAE). Instead of using pixel-by-pixel loss, we enforce deep feature consistency between the input and the output of a VAE, which ensures the VAE's output to preserve the spatial correlation characteristics of the input, thus leading the output to have a more natural visual appearance and better perceptual quality. Based on recent deep learning works such as style transfer, we employ a pre-trained deep convolutional neural network (CNN) and use its hidden features to define a feature perceptual loss for VAE training. Evaluated on the CelebA face dataset, we show that our model produces better results than other methods in the literature. We also show that our method can produce latent vectors that can capture the semantic information of face expressions and can be used to achieve state-of-the-art performance in facial attribute prediction.

研究动机与目标

  • 为解决标准VAE生成图像模糊的问题,该问题源于使用无法保留空间相关性的逐像素重建损失。
  • 通过强制预训练CNN提取的深层特征表示的一致性,提升VAE生成图像的感知质量。
  • 评估所提出的VAE学习到的潜在空间是否能捕捉有意义的语义和概念信息以用于下游任务。
  • 利用来自DFC-VAE的潜在向量在面部属性预测任务中实现最先进性能。

提出的方法

  • 用从预训练CNN(如VGGNet)在输入图像和重建图像上提取的高层特征计算的感知损失,替代VAE中的标准逐像素L2重建损失。
  • 利用预训练CNN多个层的特征计算多尺度感知损失,增强空间相关性一致性。
  • 通过优化感知重建损失与KL散度正则项之和,端到端训练VAE。
  • 从编码器网络中提取潜在向量,并将其作为下游分类任务(如面部属性预测)的输入特征。
  • 在潜在向量上应用线性SVM分类器,对CelebA数据集上的二值面部属性进行预测。
  • 使用真实面部关键点对人脸区域进行裁剪,以确保不同方法间评估的一致性。

实验结果

研究问题

  • RQ1用深层特征感知损失替代逐像素重建损失,能否提升VAE生成图像的视觉质量和感知真实感?
  • RQ2所提出的DFC-VAE模型的潜在空间是否能捕捉关于人脸图像的有意义语义和概念信息?
  • RQ3从DFC-VAE学习到的潜在向量是否能在面部属性预测任务中相比其他特征提取方法达到最先进性能?
  • RQ4基于深层CNN特征的感知损失与传统逐像素损失相比,在保留空间相关性和图像结构方面表现如何?

主要发现

  • DFC-VAE模型生成的面部图像比使用逐像素损失的基线VAE更清晰、更具视觉真实感。
  • 使用VAE-345的潜在向量,面部属性预测准确率达到88.73%,优于所有对比方法,包括PANDA-l(85.43%)和VGG-FC(79.85%)。
  • DFC-VAE的潜在空间展现出强大的概念表征能力,支持平滑插值和属性操控。
  • 基于深层特征的感知损失能有效保留空间相关性,提升图像质量,减少标准VAE中常见的模糊现象。
  • 该方法表明,预训练网络的深层特征可作为VAE训练的强大归纳偏置,同时增强生成能力和表征学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。