Skip to main content
QUICK REVIEW

[论文解读] SelfNeRF: Fast Training NeRF for Human from Monocular Self-rotating Video

Bo Peng, Jun Hu|arXiv (Cornell University)|Oct 4, 2022
Advanced Vision and Imaging被引用 4
一句话总结

SelfNeRF 提出了一种快速、单目的人体动作新视角合成方法,利用基于表面的多分辨率哈希编码,将训练时间加速至约20分钟。通过利用重建人体表面的帧间几何一致性(基于K近邻点和符号距离),该方法在无需多视角输入或大量训练的情况下,仅通过自旋转视频即可实现高保真结果。

ABSTRACT

In this paper, we propose SelfNeRF, an efficient neural radiance field based novel view synthesis method for human performance. Given monocular self-rotating videos of human performers, SelfNeRF can train from scratch and achieve high-fidelity results in about twenty minutes. Some recent works have utilized the neural radiance field for dynamic human reconstruction. However, most of these methods need multi-view inputs and require hours of training, making it still difficult for practical use. To address this challenging problem, we introduce a surface-relative representation based on multi-resolution hash encoding that can greatly improve the training speed and aggregate inter-frame information. Extensive experimental results on several different datasets demonstrate the effectiveness and efficiency of SelfNeRF to challenging monocular videos.

研究动机与目标

  • 仅使用单目自旋转视频,实现快速、高保真的人体动作新视角合成。
  • 克服现有基于NeRF的人体重建方法训练时间过长的问题(通常需要数小时且依赖多视角输入)。
  • 通过引入基于表面的表示,将此前仅限于静态场景的多分辨率哈希编码扩展至动态人体形状。
  • 通过将训练时间从数小时缩短至20分钟以内,提升非专业用户的实际可用性。

提出的方法

  • 通过计算规范人体网格到K近邻点和符号距离,构建基于表面的表示,以编码时间一致性。
  • 将多分辨率哈希编码应用于基于表面的表示,以加速NeRF训练,同时保留几何细节。
  • 模型使用体素渲染,并结合光度和几何引导损失,优化每条光线的颜色和密度预测。
  • 利用预先重建的人体表面序列(例如来自SelfRecon或SMPL)锚定表示,实现跨帧特征聚合。
  • 定义一个规范空间,用于计算KNN和符号距离,从而在时间上实现一致的特征学习。
  • 将NeRF MLP条件化为基于哈希编码的表面相对特征,以预测新视角合成所需的辐射度和密度。

实验结果

研究问题

  • RQ1多分辨率哈希编码能否有效扩展至从单目输入重建动态人体形状,以加速NeRF训练?
  • RQ2在单目设置下,如何高效建模帧间几何一致性以提升重建质量?
  • RQ3基于表面的表示能否在训练速度和保真度方面优于标准的基于顶点的特征学习?
  • RQ4人体表面质量(如SMPL与SelfRecon)对最终渲染质量与训练稳定性有何影响?

主要发现

  • SelfNeRF 在新视角合成上达到PSNR 25.49和SSIM 0.873,优于NeuralBody和AnimatableNeRF。
  • 该方法约在20分钟内收敛,显著优于现有方法所需超过一小时甚至数小时的训练时间。
  • 与基于顶点的特征优化相比,使用多分辨率哈希编码使训练时间至少缩短十倍。
  • 当姿态估计不稳定时,基于SelfRecon生成的表面相比SMPL能获得更优结果,归因于更优的时间对应性。
  • 几何引导损失可防止模式崩溃,并促进收敛至更逼真的类人形结构。
  • 即使SMPL参数准确,SelfNeRF仍优于现有方法,展现出强鲁棒性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。