Skip to main content
QUICK REVIEW

[论文解读] Tensor-based Emotion Editing in the StyleGAN Latent Space

René Haas, Stella Graßhof|arXiv (Cornell University)|May 12, 2022
Generative Adversarial Networks and Image Synthesis被引用 7
一句话总结

本论文提出一种基于张量的方法,利用高阶奇异值分解(HOSVD)在StyleGAN2的潜在空间中发现解耦的语义方向,用于编辑面部情绪和偏航旋转。通过使用e4e编码器将3D面部表情数据库(BU-3DFE)编码至W+空间,该方法提取了六种典型情绪和偏航的全局线性方向,实现在真实人脸图像上的高保真、身份保持型编辑,性能与当前最先进(SOTA)方法相当。

ABSTRACT

In this paper, we use a tensor model based on the Higher-Order Singular Value Decomposition (HOSVD) to discover semantic directions in Generative Adversarial Networks. This is achieved by first embedding a structured facial expression database into the latent space using the e4e encoder. Specifically, we discover directions in latent space corresponding to the six prototypical emotions: anger, disgust, fear, happiness, sadness, and surprise, as well as a direction for yaw rotation. These latent space directions are employed to change the expression or yaw rotation of real face images. We compare our found directions to similar directions found by two other methods. The results show that the visual quality of the resultant edits are on par with State-of-the-Art. It can also be concluded that the tensor-based model is well suited for emotion and yaw editing, i.e., that the emotion or yaw rotation of a novel face image can be robustly changed without a significant effect on identity or other attributes in the images.

研究动机与目标

  • 在StyleGAN2潜在空间中发现对应于典型面部情绪和偏航旋转的解耦语义方向。
  • 通过使用e4e编码器改进先前基于HOSVD的模型,在潜在码重建质量和可编辑性方面实现提升。
  • 实现全局可重用的语义方向,可直接应用于任意潜在码而无需重新估计子空间参数。
  • 通过定量指标和预训练的表情分类器验证编辑结果的语义可解释性与视觉质量。

提出的方法

  • 使用e4e编码器将BU-3DFE 3D面部表情数据库嵌入到StyleGAN2的W+潜在空间中,以获得高质量且可编辑的潜在码。
  • 从编码数据构建多线性张量模型,并应用HOSVD将张量分解为核心成分与因子矩阵,从而分离出身份、表情和偏航的语义子空间。
  • 对情绪和偏航子空间进行截断,以提取对应于特定情绪状态和旋转角度的潜在空间中的线性方向。
  • 将所得方向直接应用于W+空间中的任意潜在码,以编辑面部表情或实现人脸正前方化,无需微调或重新估计。
  • 在张量模型中采用满秩参数化,相比先前的低秩近似方法,显著提升了重建保真度。
  • 通过感知(LPIPS)和身份(ArcFace)相似性度量,以及在FER2013数据集上预训练的表情分类器(PyFeat)对编辑结果进行评估。

实验结果

研究问题

  • RQ1基于HOSVD的张量建模能否在StyleGAN2的W+空间中发现解耦的、全局的语义方向,用于面部情绪和偏航旋转?
  • RQ2与直接映射相比,使用e4e编码器在潜在码质量与可编辑性方面有何改进?
  • RQ3所发现的方向在编辑过程中在多大程度上保持了身份特征,并避免了与其他属性的纠缠?
  • RQ4所提方法的视觉与定量结果与GANSpace和InterFaceGAN等SOTA方法相比如何?
  • RQ5为何某些情绪编辑(如恐惧、厌恶)在分类器输出中出现意外的标签偏移?这是由于模型局限性还是数据分布差异所致?

主要发现

  • 所提方法在视觉编辑质量方面与GANSpace和InterFaceGAN等SOTA方法相当,经定性比较验证。
  • 在FEI数据库上的定量评估显示,本方法的LPIPS更低(0.305 ± 0.004),ArcFace身份相似性更高(0.372 ± 0.008),优于InterFaceGAN(LPIPS: 0.315 ± 0.003,ArcFace: 0.402 ± 0.008),表明其正面化保真度更优。
  • 使用本方法生成的正前方图像中视线方向正对前方,而InterFaceGAN则产生视线错位。
  • 表情编辑显著提升了目标情绪类别(愤怒、快乐、悲伤、惊讶)的概率质量,证实了语义可解释性。
  • 厌恶方向的编辑同时增加了厌恶与愤怒的概率,恐惧编辑则提升了惊讶的概率——这归因于BU-3DFE与FER2013之间的数据分布差异,而非模型局限性。
  • 该方法实现了全局可重用的方向:方向计算一次后,可直接应用于任意潜在码,无需重新估计,显著优于先前方法的效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。