Skip to main content
QUICK REVIEW

[论文解读] NeuS2: Fast Learning of Neural Implicit Surfaces for Multi-view Reconstruction

Yiming Wang, Qin Han|arXiv (Cornell University)|Dec 10, 2022
Advanced Vision and Imaging被引用 8
一句话总结

NeuS2 相较于先前方法将神经隐式表面重建速度提升了 100 倍,实现了静态场景的亚分钟级训练,以及动态序列约每帧 20 秒的训练速度。它采用多分辨率哈希编码,并结合一种新颖且高效的二阶导数计算方法与渐进式训练策略,实现了高保真度重建并具备稳定的收敛性。

ABSTRACT

Recent methods for neural surface representation and rendering, for example NeuS, have demonstrated the remarkably high-quality reconstruction of static scenes. However, the training of NeuS takes an extremely long time (8 hours), which makes it almost impossible to apply them to dynamic scenes with thousands of frames. We propose a fast neural surface reconstruction approach, called NeuS2, which achieves two orders of magnitude improvement in terms of acceleration without compromising reconstruction quality. To accelerate the training process, we parameterize a neural surface representation by multi-resolution hash encodings and present a novel lightweight calculation of second-order derivatives tailored to our networks to leverage CUDA parallelism, achieving a factor two speed up. To further stabilize and expedite training, a progressive learning strategy is proposed to optimize multi-resolution hash encodings from coarse to fine. We extend our method for fast training of dynamic scenes, with a proposed incremental training strategy and a novel global transformation prediction component, which allow our method to handle challenging long sequences with large movements and deformations. Our experiments on various datasets demonstrate that NeuS2 significantly outperforms the state-of-the-arts in both surface reconstruction accuracy and training speed for both static and dynamic scenes. The code is available at our website: https://vcai.mpi-inf.mpg.de/projects/NeuS2/ .

研究动机与目标

  • 解决如 NeuS 等最先进神经隐式表面方法在静态与动态场景重建中训练时间过长(例如约 8 小时)的问题。
  • 通过大幅降低每帧训练时间,使神经隐式表面在包含数千帧的动态场景中实现实际应用。
  • 为基于 ReLU 的 MLP 设计一种高效、内存友好的二阶导数计算方法,以加速 GPU 上的反向传播。
  • 通过渐进式学习策略,从粗到细逐步优化多分辨率哈希编码,从而稳定并加速训练收敛。
  • 通过带有全局变换预测的增量训练方法,将该方法扩展至具有大位移与形变的长动态序列。

提出的方法

  • 使用可学习特征向量的多分辨率哈希编码来参数化神经 SDF,实现对隐式表面表示的快速、可微访问。
  • 推导出基于 ReLU 的 MLP 中二阶导数的闭式、轻量级公式,支持极低内存占用的 CUDA 内核高度优化实现。
  • 实现一种渐进式训练策略,从粗到细逐步初始化并优化哈希编码特征,提升优化稳定性与收敛速度。
  • 提出一种用于动态场景的增量训练框架,通过利用前一帧的几何与外观作为先验,顺序微调帧级表示。
  • 引入全局变换预测模块,在训练前对齐连续帧,减轻遮挡或高度形变区域中的误差累积。
  • 利用基于 SDF 的表面约束进行可微体积渲染,确保几何精度与逼真的新视角合成。

实验结果

研究问题

  • RQ1神经 SDF 中的二阶导数能否被高效且准确地计算,以实现在现代 GPU 上的实时训练加速?
  • RQ2从粗到细逐步优化多分辨率哈希编码的渐进式训练策略,是否能显著提升收敛性与重建质量?
  • RQ3结合全局变换预测的增量训练能否稳定并加速对具有大帧间位移的长动态序列的学习?
  • RQ4在静态与动态场景下,所提方法在重建精度与训练速度方面相较于最先进方法表现如何?
  • RQ5该高效二阶导数计算方法在不同网络架构与数据集上具有多大程度的泛化能力?

主要发现

  • NeuS2 相较于原始 NeuS 实现了 100 倍的速度提升,在 DTU 数据集上静态场景重建时间低于 6 分钟(对比约 8 小时),PSNR 达到 28.82。
  • 所提出的二阶导数计算比 PyTorch 的 autograd 快 30%,比有限差分基线快 25%,PSNR 达到 35.5(对比基线的 33.4)。
  • 渐进式训练策略将 DTU 数据集上的平均 Chamfer 距离(CD)从 1.48 降低至 0.70,提升了重建精度,并将训练时间缩短至 5 分钟。
  • 同时包含全局变换预测与渐进式训练的完整模型在 DTU 上达到 PSNR 28.18 与 LPIPS 0.0474,优于所有消融实验模型,在几何与外观上均表现更优。
  • 对于动态场景,NeuS2 每帧重建时间约为 20 秒,可实现 20,000 帧序列的高质量、稳定且细节丰富的重建。
  • 消融研究证实,全局变换预测与渐进式训练均不可或缺:任一模块的移除均会导致表面噪声与图像模糊,归因于陷入局部极小值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。