Skip to main content
QUICK REVIEW

[论文解读] Label Denoising Adversarial Network (LDAN) for Inverse Lighting of Face Images

Hao Zhou, Jin Sun|arXiv (Cornell University)|Sep 6, 2017
Image Enhancement Techniques参考文献 21被引用 7
一句话总结

本文提出标签去噪对抗网络(LDAN),一种深度卷积神经网络,通过使用带有干净标签的合成数据,从单张人脸图像回归球谐照明参数,以缓解真实数据中标签噪声的问题。通过结合基于生成对抗网络(GAN)的特征域自适应与回归损失,LDAN 的推理速度比基于优化的方法快 100,000 倍,并在相似光照条件下展现出更高的准确性和一致性,优于先前方法。

ABSTRACT

Lighting estimation from face images is an important task and has applications in many areas such as image editing, intrinsic image decomposition, and image forgery detection. We propose to train a deep Convolutional Neural Network (CNN) to regress lighting parameters from a single face image. Lacking massive ground truth lighting labels for face images in the wild, we use an existing method to estimate lighting parameters, which are treated as ground truth with unknown noises. To alleviate the effect of such noises, we utilize the idea of Generative Adversarial Networks (GAN) and propose a Label Denoising Adversarial Network (LDAN) to make use of synthetic data with accurate ground truth to help train a deep CNN for lighting regression on real face images. Experiments show that our network outperforms existing methods in producing consistent lighting parameters of different faces under similar lighting conditions. Moreover, our method is 100,000 times faster in execution time than prior optimization-based lighting estimation approaches.

研究动机与目标

  • 解决野外真实人脸图像缺乏真实光照标签的问题。
  • 在现有估计方法产生的标签存在噪声的情况下,提升真实人脸图像上的光照回归性能。
  • 利用带有精确光照标签的合成人脸图像,训练一个鲁棒的深度卷积神经网络,以支持真实场景下的推理。
  • 结合基于 GAN 的域自适应与回归损失,确保有意义且标签一致的特征映射。
  • 实现在低分辨率人脸图像上快速、准确的光照估计,适用于图像编辑与伪造检测等应用。

提出的方法

  • LDAN 采用双流结构:特征网络用于真实数据,光照网络用于预测球谐系数。
  • 模型在带有干净标签的合成数据上进行预训练,固定合成数据的光照网络与特征网络。
  • 域自适应模块使用判别器区分真实与合成的光照特征,同时训练真实数据的特征网络以欺骗判别器。
  • 真实数据的特征网络与回归损失联合优化,以最小化对噪声真实标签的预测误差。
  • 该方法基于假设:合成数据提供无噪声的监督信号,而真实数据标签虽有噪声,但仍包含有用信息。
  • 网络在 64×64 RGB 人脸图像上端到端训练,以支持低分辨率输入。

实验结果

研究问题

  • RQ1带有精确光照标签的合成数据是否能提升深度卷积神经网络在具有噪声标签的真实人脸图像上的性能?
  • RQ2将基于 GAN 的域自适应与回归损失结合,对光照回归准确率有何影响?
  • RQ3所提方法是否能实现比基于优化的光照估计更快的推理速度?
  • RQ4在相同光照条件下,该模型是否能在不同人脸间产生更一致的光照预测?
  • RQ5在鲁棒性与泛化能力方面,该方法与最先进方法相比表现如何?

主要发现

  • LDAN 相较于 SIRFS 方法实现 100,000 倍的速度提升,在 GPU 上每秒可处理 2,400 张人脸图像。
  • 在 MultiPie 数据集上,LDAN 在欧氏距离与 Q-测量指标上均优于 SIRFS SH 与 REAL 基线方法,且在相同光照条件下的人脸对之间表现出更高的预测一致性。
  • 消融实验表明,若移除 GAN 损失或回归损失,性能均会下降,证实了两个组件的必要性。
  • 该模型在 64×64 分辨率人脸图像上仍保持高精度,而基于 3DMM 的方法因法向估计不准确而失效。
  • LDAN 预测的光照具有物理合理性,包括非负的直流分量,而 '3D 光照' 方法有时会产生负的直流值。
  • 使用 LDAN 预测的 SH 参数进行视觉合成,其光照效果比 SIRFS SH 更为逼真,尤其在均匀光照条件下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。