[论文解读] Rotate-and-Render: Unsupervised Photorealistic Face Rotation from Single-View Images
本文提出 Rotate-and-Render,一种新颖的无监督框架,仅使用真实场景图像即可实现单视角图像的逼真人脸旋转。通过将3D人脸网格旋转至任意姿态并还原,再利用生成对抗网络(GAN)将渲染输出映射到真实图像分布,该方法在无需成对数据或标签的情况下,实现了最先进的身份保留效果与生成质量。
Though face rotation has achieved rapid progress in recent years, the lack of high-quality paired training data remains a great hurdle for existing methods. The current generative models heavily rely on datasets with multi-view images of the same person. Thus, their generated results are restricted by the scale and domain of the data source. To overcome these challenges, we propose a novel unsupervised framework that can synthesize photo-realistic rotated faces using only single-view image collections in the wild. Our key insight is that rotating faces in the 3D space back and forth, and re-rendering them to the 2D plane can serve as a strong self-supervision. We leverage the recent advances in 3D face modeling and high-resolution GAN to constitute our building blocks. Since the 3D rotation-and-render on faces can be applied to arbitrary angles without losing details, our approach is extremely suitable for in-the-wild scenarios (i.e. no paired data are available), where existing methods fall short. Extensive experiments demonstrate that our approach has superior synthesis quality as well as identity preservation over the state-of-the-art methods, across a wide range of poses and domains. Furthermore, we validate that our rotate-and-render framework naturally can act as an effective data augmentation engine for boosting modern face recognition systems even on strong baseline models.
研究动机与目标
- 解决现有方法在人脸旋转任务中因缺乏高质量成对训练数据而导致泛化能力差与分辨率受限的问题。
- 克服依赖受控多视角数据集(如 Multi-PIE 或 300W-LP)的监督方法在领域与分辨率上的限制。
- 仅使用来自真实场景的单视角图像,无需成对数据或身份标签,即可实现任意角度的逼真人脸旋转。
- 通过3D旋转-渲染循环构建自监督训练信号,以在生成逼真结果的同时保持身份与细节的一致性。
- 证明生成的人脸可有效增强大规模人脸识别基准的训练数据,并在强基线模型下提升性能。
提出的方法
- 使用现成的3D人脸拟合网络(3DDFA)从单张2D人脸图像重建3D网格。
- 将3D网格旋转至目标姿态并重新渲染为2D图像,生成自监督信号。
- 将网格旋转回原始姿态,并利用从旋转后图像中提取的纹理重新渲染,生成包含遮挡区域的重建图像。
- 应用基于GAN的图像到图像翻译网络,将不完整的渲染图像映射到真实图像分布中的逼真图像。
- 结合多尺度判别器与VGG特征损失,提升逼真度与细节保留效果,尤其在极端姿态下表现更优。
- 以端到端方式完全无监督地训练整个流程,无需成对数据或身份标注。
实验结果
研究问题
- RQ1是否可以在无需成对多视角数据或任何形式监督的情况下实现逼真人脸旋转?
- RQ23D网格旋转与渲染能否作为生成高保真、身份一致的人脸图像的强自监督信号?
- RQ3该方法是否能在无需领域特定微调的情况下,泛化至多样化的真实场景图像与任意旋转角度?
- RQ4生成的人脸在多大程度上能提升大规模人脸识别系统的性能,即使在使用强基线模型时?
- RQ53D先验与基于GAN的翻译相结合,为何能优于现有的基于重建或基于GAN的正面化方法?
主要发现
- 所提出的 Rotate-and-Render 框架在 LFW 上取得 83.1 的 FID 分数,在 IJB-A 上取得 70.9 的 FID 分数,优于现有无监督方法。
- 在 MegaFace 基准测试中,该方法使 ResNet-50 在 100 万干扰样本下的 Rank-1 准确率达到 98.44%,超越 ArcFace R100 模型。
- 即使在 MS1MV2 和 ResNet-18 等强基线模型下,使用生成人脸进行训练数据增强,也能使识别准确率最高提升 0.48%。
- 消融实验表明,VGG 损失与多尺度判别器对高保真结果均至关重要,尤其在极端姿态下表现更优。
- 该方法在所有测试姿态(包括 ±90°)下均能生成接近逼真的结果,伪影极少,身份保持能力极强。
- 该框架完全无监督,无需任何成对数据、标签或身份信息,可直接应用于任意真实场景图像集合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。