Skip to main content
QUICK REVIEW

[论文解读] GazeCorrection:Self-Guided Eye Manipulation in the wild using Self-Supervised Generative Adversarial Networks

Jichao Zhang, Meng Sun|arXiv (Cornell University)|Jun 3, 2019
Image Processing Techniques and Applications参考文献 28被引用 8
一句话总结

本文提出 GazeGAN,一种用于在非受限(野外)图像中进行视线校正的自监督生成对抗网络,采用无需标注头部姿态或眼睛角度数据的图像修复框架。该方法利用自引导预训练模型提取与角度无关的特征以保持身份一致性,并引入自监督模块以稳定训练并提升真实感,在野外数据集的定性和定量评估中均达到最先进性能。

ABSTRACT

Gaze correction aims to redirect the person's gaze into the camera by manipulating the eye region, and it can be considered as a specific image resynthesis problem. Gaze correction has a wide range of applications in real life, such as taking a picture with staring at the camera. In this paper, we propose a novel method that is based on the inpainting model to learn from the face image to fill in the missing eye regions with new contents representing corrected eye gaze. Moreover, our model does not require the training dataset labeled with the specific head pose and eye angle information, thus, the training data is easy to collect. To retain the identity information of the eye region in the original input, we propose a self-guided pretrained model to learn the angle-invariance feature. Experiments show our model achieves very compelling gaze-corrected results in the wild dataset which is collected from the website and will be introduced in details. Code is available at https://github.com/zhangqianhui/GazeCorrection.

研究动机与目标

  • 解决在头部姿态和眼睛角度变化极大的真实世界图像中进行视线校正的问题。
  • 通过利用自监督学习,消除对昂贵的姿态标注训练数据的需求。
  • 在视线操控过程中,利用与角度无关的特征保留原始眼区的身份信息。
  • 通过自监督模块提升对抗训练的稳定性和质量,实现更优的视线校正效果。
  • 实现高保真、逼真的视线校正,具有良好的感知真实感和在各种头部姿态下的鲁棒性。

提出的方法

  • 该方法基于生成对抗网络(GAN)的全卷积图像修复模型,用于合成校正后的眼区。
  • 引入一种自引导预训练模型,从原始眼区提取与角度无关的特征,用于引导生成器和判别器。
  • 生成器以与角度无关的特征为条件,确保视线校正过程中身份的一致性。
  • 在生成器和判别器中均添加自监督学习模块,通过二分类损失实现对左眼和右眼的预测,以稳定训练并提升真实感。
  • 模型采用全局与局部判别器架构,以在眼区实现高保真、感知真实的修复效果。
  • 训练过程端到端进行,无需成对的真实眼角度或头部姿态标注,支持从野外轻松收集数据。

实验结果

研究问题

  • RQ1是否可以在不依赖标注头部姿态或眼角度数据的情况下,有效实现非受限真实世界图像中的视线校正?
  • RQ2在眼角度和姿态变化极大的情况下,如何在视线操控过程中保留原始眼区的身份信息?
  • RQ3自监督学习在多大程度上提升了视线校正中对抗训练的稳定性和质量?
  • RQ4与标准 GAN 基于的图像修复方法相比,所提出的自引导特征提取机制在保留面部身份方面表现如何?
  • RQ5与现有最先进视线校正模型相比,该方法在真实感和校正准确性方面的性能如何?

主要发现

  • 在 NewGaze 测试集上,GazeGAN 的 Inception Score (IS) 达到 3.10 ± 0.12,Fréchet Inception Distance (FID) 为 28.34,优于 GLGAN(IS: 2.87 ± 0.07)和 DeepWarp,两项指标均表现更优。
  • 在用户研究中,GazeGAN 获得 35.40% 的投票为最佳结果,显著高于 StarGAN(29.60%)、GLGAN(21.87%)和 DeepWarp(13.13%),表明其具有更优的感知真实感。
  • 消融研究证实,自监督学习模块在所有训练迭代中均提升了 IS 和 FID 分数,证明其在稳定训练和提升输出质量方面的有效性。
  • 定性结果表明,GazeGAN 在具有极端头部姿态的挑战性野外图像上,生成的视线校正比 DeepWarp 更清晰、更逼真。
  • 自引导预训练模型成功保留了不同眼角度下的身份特征,表现为校正后眼区中面部结构和纹理的一致性。
  • 模型在多样化头部姿态下具有良好的泛化能力,如附录材料和项目页面所示,在具有挑战性的现实图像中均保持一致的性能表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。