[论文解读] StyleRig: Rigging StyleGAN for 3D Control over Portrait Images
StyleRig 提出一种自监督方法,通过一种新颖的 RigNet 网络,将三维可变形面容模型(3DMM)参数映射到预训练的 StyleGAN 生成器的潜在空间中,从而实现在无需微调或人工标注的情况下,对预训练的 StyleGAN 实现类似骨骼绑定的 3D 面部控制。该方法在不损失图像真实感的前提下,实现了对姿态、表情、光照和身份等语义参数的显式、解耦控制。
StyleGAN generates photorealistic portrait images of faces with eyes, teeth, hair and context (neck, shoulders, background), but lacks a rig-like control over semantic face parameters that are interpretable in 3D, such as face pose, expressions, and scene illumination. Three-dimensional morphable face models (3DMMs) on the other hand offer control over the semantic parameters, but lack photorealism when rendered and only model the face interior, not other parts of a portrait image (hair, mouth interior, background). We present the first method to provide a face rig-like control over a pretrained and fixed StyleGAN via a 3DMM. A new rigging network, RigNet is trained between the 3DMM's semantic parameters and StyleGAN's input. The network is trained in a self-supervised manner, without the need for manual annotations. At test time, our method generates portrait images with the photorealism of StyleGAN and provides explicit control over the 3D semantic parameters of the face.
研究动机与目标
- 解决 StyleGAN 中缺乏可解释、3D 意识控制的问题,该模型虽能生成逼真的肖像,但无法对语义面部参数进行类似绑定的操控。
- 克服 3DMM 的局限性,其虽提供语义控制但缺乏真实感,且无法建模头发和背景等非面部区域。
- 在不微调生成器的前提下,实现对 StyleGAN 生成图像中 3D 面部参数(姿态、表情、光照、身份)的细粒度、解耦编辑。
- 开发一种自监督训练框架,避免人工标注,利用循环一致性与可微渲染实现高保真图像生成。
提出的方法
- 训练一个新网络 RigNet,将 3DMM 的语义参数(如身份、姿态、表情、光照)映射到固定预训练的 StyleGAN 潜在空间。
- 采用自监督的双向循环一致性损失,确保在 3DMM 空间和潜在空间中正向与逆向编辑的一致性。
- 集成可微渲染器与面部重建网络,以在图像域中计算光度重建误差,支持端到端训练。
- 利用循环一致性目标,确保对某一参数(如姿态)的修改不会无意中改变无关参数(如身份或光照)。
- 通过组合重建损失(保持图像质量)、一致性损失(维持语义完整性)和编辑损失(实现控制)来训练 RigNet。
- 通过在优化过程中采样并训练单个参数的编辑,实现使用单一网络同时控制多个参数(如姿态、表情、光照)。
实验结果
研究问题
- RQ1我们能否在不微调或人工标注的情况下,实现对预训练 StyleGAN 生成器的语义化、3D 意识控制?
- RQ2自监督方法能否有效将 3DMM 参数映射到 StyleGAN 的潜在空间,同时保持图像真实感并解耦语义属性?
- RQ3在同时编辑多个 3D 面部参数时,该方法在保持身份与场景一致性方面表现如何?
- RQ4通过显式 3D 参数控制,该方法在多大程度上缓解了 StyleGAN 潜在空间中属性的纠缠问题?
- RQ5当前方法在控制非面部图像成分(如头发、背景、口腔内部)方面存在哪些局限性?
主要发现
- StyleRig 实现了对 StyleGAN 生成肖像的交互式、类似绑定的控制,使用 3DMM 参数实现高质量编辑并获得逼真结果。
- 该方法在语义编辑任务中达到当前最优性能,优于使用直接潜在向量引导或修改损失函数的基线方法。
- 循环一致性损失显著提升了编辑保真度,有效防止了编辑过程中身份和场景参数的意外改变。
- 成功实现了对姿态、表情和光照的同步控制,且在编辑过程中保持了身份的一致性。
- 该方法对身份和场景变化具有鲁棒性,如跨域编辑实验所示,参数可从源图像成功迁移到目标图像。
- 尽管性能优异,但该方法仍无法控制如头发或背景等细节,因 3DMM 未建模这些区域,导致其在编辑过程中变化不可预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。