Skip to main content
QUICK REVIEW

[论文解读] H-NeRF: Neural Radiance Fields for Rendering and Temporal Reconstruction of Humans in Motion

Hongyi Xu, Thiemo Alldieck|arXiv (Cornell University)|Oct 26, 2021
3D Shape Modeling and Analysis参考文献 57被引用 75
一句话总结

H-NeRF 将神经辐射场与隐式人体模型(imGHUM)结合起来,从稀疏视图渲染并对运动中的人体进行时间重建,使其能够泛化到新姿态、形状和视角。

ABSTRACT

We present neural radiance fields for rendering and temporal (4D) reconstruction of humans in motion (H-NeRF), as captured by a sparse set of cameras or even from a monocular video. Our approach combines ideas from neural scene representation, novel-view synthesis, and implicit statistical geometric human representations, coupled using novel loss functions. Instead of learning a radiance field with a uniform occupancy prior, we constrain it by a structured implicit human body model, represented using signed distance functions. This allows us to robustly fuse information from sparse views and generalize well beyond the poses or views observed in training. Moreover, we apply geometric constraints to co-learn the structure of the observed subject -- including both body and clothing -- and to regularize the radiance field to geometrically plausible solutions. Extensive experiments on multiple datasets demonstrate the robustness and the accuracy of our approach, its generalization capabilities significantly outside a small training set of poses and views, and statistical extrapolation beyond the observed shape.

研究动机与目标

  • 推动从稀疏摄像机视点实现移动人体的自由视点视频。
  • 开发一个几何感知的 NeRF,并以结构化的隐式人体模型(imGHUM)进行正则化。
  • 与 NeRF 共同学习一个残余 SDF,以捕捉超出基础人体模型的衣物与头发细节。
  • 在对未见姿态、视角和形状具有强泛化能力的前提下,实现稳健的 4D 重建与渲染。

提出的方法

  • 共同学习一个辐射场 Fω,将 x, v 映射到 (c, σ),以及一个残余 SDF ΔHω 将 x 映射到 Δd,条件为人体姿态 θ 与根变换 T。
  • 使用 imGHUM 作为规范帧先验来指导几何并在各帧之间提供时空对应。
  • 通过将来自 SDF 的伪 alpha 与 NeRF 的 alpha 混合,将其耦合为隐式 SDF,从而在表面附近对不透明度进行正则化。
  • 将 NeRF 的颜色和几何与姿态编码 (β, θ, T) 相关联,并对动态序列将观测数据变形到规范帧。
  • 引入损失项 L_blend、L_geom、L_seg,以及基于 Eikonal 的正则化,以强制表面一致性与几何合理性。
  • 在训练过程中微调姿态/形状修正 Δβ 与 Δθ(t),以改善与前景的拟合。

实验结果

研究问题

  • RQ1基于 NeRF 的表示是否能够与隐式人体模型融合,从稀疏视图渲染并重建运动中的人体?
  • RQ2与 NeRF 共同学习的残余 SDF 是否相较于基础 NeRF 能提高几何与外观,尤其是衣物与头发?
  • RQ3在有限训练数据下,该方法对新姿态、形状以及未见摄像机视角的泛化能力如何?
  • RQ4以姿态条件几何与外观对渲染保真度和时间一致性有何影响?
  • RQ5该方法是否能够在稀疏摄像机设置下鲁棒地处理静态与动态图像?

主要发现

  • 在稀疏视图条件下,H-NeRF 在静态场景中对比 NeRF 与 IDR,在新视图渲染和三维几何重建方面具有优越性。
  • 对于动态图像中的人,H-NeRF 在图像质量(PSNR/SSIM/LPIPS)和几何指标(Ch、NC、IoU)方面均优于 NeuralBody,且在多数据集上表现良好。
  • H-NeRF 对未见姿态和形状具有泛化能力,对帧/帧数消融具有鲁棒性,在四摄像机设置中甚至可仅用每摄像机 10 帧时间信息运行。
  • 通过对人体潜在编码进行条件化并利用 imGHUM 作为强几何先验,该框架实现了准确的自由视点渲染与 4D 重建。
  • 定量结果显示在 RenderPeople、GHS3D、PeopleSnapshot、Human3.6M 数据集上,PSNR/SSIM 提升且几何指标具有竞争力或更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。