Skip to main content
QUICK REVIEW

[论文解读] Portrait Neural Radiance Fields from a Single Image

Chen Gao, YiChang Shih|arXiv (Cornell University)|Dec 10, 2020
Generative Adversarial Networks and Image Synthesis参考文献 74被引用 42
一句话总结

该论文提出一种方法,通过在 Light-stage 肖像数据集上进行元学习预训练 NeRF,并对输入主体在一个 canonical face space 内进行微调,从单张头部照片合成肖像神经辐射场。

ABSTRACT

We present a method for estimating Neural Radiance Fields (NeRF) from a single headshot portrait. While NeRF has demonstrated high-quality view synthesis, it requires multiple images of static scenes and thus impractical for casual captures and moving subjects. In this work, we propose to pretrain the weights of a multilayer perceptron (MLP), which implicitly models the volumetric density and colors, with a meta-learning framework using a light stage portrait dataset. To improve the generalization to unseen faces, we train the MLP in the canonical coordinate space approximated by 3D face morphable models. We quantitatively evaluate the method using controlled captures and demonstrate the generalization to real portrait images, showing favorable results against state-of-the-arts.

研究动机与目标

  • 实现基于单张图像的照片级真实感肖像视图合成。
  • 将 NeRF 泛化到未见主体,且无需多张 captures。
  • 通过一个 canonical face space 的人脸几何先验来处理头发、上半头与躯干。
  • 提供多视角肖像数据集以便进行定量评估。
  • 展示诸如新视角合成和透视/视场(FOV)操作等应用。

提出的方法

  • 在 light-stage 肖像数据集上对基于 MLP 的 NeRF 进行预训练,以学习通用的面部先验。
  • 使用来自 3D Morphable Model 几何的刚性变换,将世界坐标扭曲到 canonical face space。
  • 在单一输入正面视图上微调预训练的 NeRF,以适应被摄体(theta_s)。
  • 在将射线扭曲到规范空间后,通过体积渲染来渲染新视图。
  • 通过基于梯度的元学习进行训练,以实现对未见主体的快速适应。
  • 使用规范坐标以在发型、配饰和上半头区域提供更好的泛化性和真实感。

实验结果

研究问题

  • RQ1是否可以从单张肖像图像有效训练出一个 NeRF,以合成同一主体的新视角?
  • RQ2与随机初始化或朴素预训练相比,元学习加 canonical face space 是否能提升对未见主体的泛化?
  • RQ3所提出的方法在受控数据和真实世界数据上与现有最先进的肖像视角合成方法相比如何?
  • RQ4训练数据规模和输入视角数量对合成质量有何影响?
  • RQ5在将单图像肖像 NeRF 应用于真实世界图像时,存在哪些局限性和失效模式?

主要发现

  • 我们的方法在 Light-stage 数据集上实现了更高的 PSNR、更高的 SSIM,以及更低的 LPIPS(PSNR 23.92, SSIM 0.7688, LPIPS 0.161),优于以往的肖像视角合成方法。
  • 带有元学习加 canonical face coordinates 的预训练相对于随机初始化或朴素预训练,显著提升了对未见主体的泛化。
  • Canonical face space 的扭曲减少了眼睛和下巴处的伪影,并在定量指标上优于使用世界坐标。
  • 在单个前摄视图上微调即可实现真实、保持身份特征的多主体新视角合成,涵盖发型和配饰等多样化主体。
  • 在测试阶段增加更多输入视角时,性能提升显著(从 1 视角到 5 视角,PSNR 由 24.98 增至 32.45 等)。
  • 该方法具有透视操控能力(使用焦距调整进行 dollying),这是因为它采用了三维神经表示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。