Skip to main content
QUICK REVIEW

[论文解读] HumanNeRF: Free-viewpoint Rendering of Moving People from Monocular Video

Chung-Yi Weng, Brian Curless|arXiv (Cornell University)|Jan 11, 2022
Advanced Vision and Imaging被引用 5
一句话总结

HumanNeRF 通过学习一个规范 T 姿势体素表示和一个将该表示通过反向变形映射到每一帧的运动场,实现了从单目视频中进行自由视角渲染移动人体。该方法在定量指标和视觉质量方面均达到最先进水平,尤其在捕捉衣物褶皱和新视角下面部外观等精细细节方面表现优异。

ABSTRACT

We introduce a free-viewpoint rendering method -- HumanNeRF -- that works on a given monocular video of a human performing complex body motions, e.g. a video from YouTube. Our method enables pausing the video at any frame and rendering the subject from arbitrary new camera viewpoints or even a full 360-degree camera path for that particular frame and body pose. This task is particularly challenging, as it requires synthesizing photorealistic details of the body, as seen from various camera angles that may not exist in the input video, as well as synthesizing fine details such as cloth folds and facial appearance. Our method optimizes for a volumetric representation of the person in a canonical T-pose, in concert with a motion field that maps the estimated canonical representation to every frame of the video via backward warps. The motion field is decomposed into skeletal rigid and non-rigid motions, produced by deep networks. We show significant performance improvements over prior work, and compelling examples of free-viewpoint renderings from monocular video of moving humans in challenging uncontrolled capture scenarios.

研究动机与目标

  • 从单目视频中实现移动人体的自由视角渲染,即使在非受控的真实场景中亦可。
  • 克服先前方法依赖多视角输入、受控实验室环境或 SMPL 基准模板的局限性。
  • 合成高保真度的新视角,准确还原几何形状、纹理以及动态细节(如衣物褶皱和面部外观)。
  • 从视频中端到端学习规范人体外观和运动场,无需依赖预定义的身体模型或人工 3D 监督。
  • 在多样且具有挑战性的野外视频(如 YouTube 和自摄视频)上实现稳健性能。

提出的方法

  • 该方法从带有逐帧分割和 3D 姿势估计的单目视频中优化学习人体在 T 姿势下的规范体素表示。
  • 通过反向变形学习一个运动场,将规范体积映射到每一帧,该运动场被分解为骨骼刚性和非刚性分量。
  • 运动场由深度神经网络表示,用于预测体素偏移,其中分别使用独立网络处理刚性(骨骼)和非刚性(可变形)运动。
  • 规范体积和运动场通过 3D 姿势优化进行端到端训练,采用重要性采样策略,基于分割掩码优先处理前景像素。
  • 该方法使用基于多分辨率 NeRF 的渲染器,从任意相机角度在暂停帧上合成新视角。
  • 训练采用可微分渲染管道,结合 L1 和感知(LPIPS)损失,且权重初始化经过仔细设置以稳定优化过程。

实验结果

研究问题

  • RQ1能否仅使用单个移动人体的单目视频,从任意相机角度合成逼真新视角?
  • RQ2能否在不依赖 SMPL 或其他参数化人体模型的前提下学习到规范体素表示?
  • RQ3学习到的运动场在捕捉复杂运动中的大范围非刚性形变(如衣物和头发运动)方面表现如何?
  • RQ4该方法能否泛化到非受控的野外视频(如 YouTube 或自摄剪辑)?
  • RQ5序列长度和姿态多样性对重建质量的影响如何?

主要发现

  • 在 ZJU-MoCap 数据集上,HumanNeRF 在第 390 号受试者上达到 PSNR 30.52、SSIM 0.9682 和 LPIPS 33.88,各项指标均优于 NeuralBody。
  • 在相同数据集上,HumanNeRF 在第 390 号受试者上取得 33.88 的 LPIPS 分数,显著低于 NeuralBody 的 52.12,表明其感知质量更优。
  • 在相同数据集上,HumanNeRF 在第 313 号受试者上达到 PSNR 29.421 和 SSIM 0.9672,优于 NeuralBody 的 29.417 和 0.9635。
  • 消融实验表明,性能在 112 帧后趋于饱和(PSNR 31.01),表明姿态多样性比帧数更重要。
  • 视觉对比显示,HumanNeRF 在未见视角中能准确捕捉衣物褶皱和面部特征等精细细节,而 NeuralBody 产生模糊结果。
  • 该方法成功重建了自摄视频和 YouTube 剪辑的规范外观,如图 18 所示,证明其在真实世界数据上的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。