Skip to main content
QUICK REVIEW

[论文解读] Non-Rigid Neural Radiance Fields: Reconstruction and Novel View Synthesis of a Dynamic Scene From Monocular Video

Edgar Tretschk, Ayush Tewari|arXiv (Cornell University)|Dec 22, 2020
Advanced Vision and Imaging被引用 7
一句话总结

NR-NeRF 通过射线弯曲将场景几何体分解为一个规范神经辐射场和一个随时间变化的形变场,从而仅从单目视频中实现一般非刚性动态场景的高保真重建与新视角合成。该方法实现了精确、视角一致的渲染,并支持无需显式监督的高级编辑操作,如运动夸张和背景稳定化。

ABSTRACT

We present Non-Rigid Neural Radiance Fields (NR-NeRF), a reconstruction and novel view synthesis approach for general non-rigid dynamic scenes. Our approach takes RGB images of a dynamic scene as input (e.g., from a monocular video recording), and creates a high-quality space-time geometry and appearance representation. We show that a single handheld consumer-grade camera is sufficient to synthesize sophisticated renderings of a dynamic scene from novel virtual camera views, e.g. a `bullet-time' video effect. NR-NeRF disentangles the dynamic scene into a canonical volume and its deformation. Scene deformation is implemented as ray bending, where straight rays are deformed non-rigidly. We also propose a novel rigidity network to better constrain rigid regions of the scene, leading to more stable results. The ray bending and rigidity network are trained without explicit supervision. Our formulation enables dense correspondence estimation across views and time, and compelling video editing applications such as motion exaggeration. Our code will be open sourced.

研究动机与目标

  • 仅使用单目视频解决一般非刚性动态场景的自由视角渲染挑战。
  • 通过将场景几何体与随时间变化的形变解耦,克服单目视频的严重欠约束问题。
  • 在无显式监督的情况下,实现高质量的新视角合成与视频编辑(例如运动夸张、背景稳定化)。
  • 通过规范体积和形变建模,在时间和视角之间保持几何与外观的一致性。
  • 即使在具有挑战性的新相机轨迹和遮挡区域下,也能实现稳定、无伪影的渲染。

提出的方法

  • 将动态场景表示为一个规范神经辐射场(静态MLP)和一个随时间非刚性弯曲射线的形变场。
  • 使用一个射线弯曲MLP建模形变,该MLP以3D点采样和图像特定的潜在码作为输入,计算非刚性射线位移。
  • 引入一个刚性网络,为每个点分配刚性评分,以在无监督条件下保留静态区域。
  • 仅使用单目RGB观测和可微渲染,联合训练规范体积和形变场。
  • 应用正则化项以约束形变幅度并保持局部形状,尤其在遮挡区域。
  • 通过操纵形变尺度(夸张/抑制)、时间插值以及通过刚性阈值强制背景稳定化,实现编辑功能。

实验结果

研究问题

  • RQ1单目视频是否足以重建一般非刚性动态场景的高保真、时空一致表示?
  • RQ2如何从单目视频中自监督地解耦形变与几何结构?
  • RQ3刚性感知形变建模是否能提升动态场景新视角合成的稳定性和减少伪影?
  • RQ4所学习的表示在多大程度上支持高级视频编辑任务,如运动夸张和时间超分辨率?
  • RQ5该方法在具有挑战性新相机轨迹和存在遮挡情况下的表现如何?

主要发现

  • NR-NeRF 从单目视频实现了高保真新视角合成,支持‘子弹时间’效果,并在新时空轨迹上实现稳定渲染。
  • 通过无任何前景-背景标注学习刚性评分,成功实现了背景的稳定渲染。
  • 通过缩放形变偏移量,成功实现了运动夸张与抑制,支持富有表现力的视频编辑。
  • 通过时间特定潜在码的线性插值实现时间超分辨率,提升帧率而无需额外数据。
  • 与基线方法(如朴素NR-NeRF和Neural Volumes)相比,该方法在挑战性新视角下表现出更优的背景稳定性和清晰度。
  • 该方法在多种动态场景(包括人体运动和复杂形变)中泛化良好,大多数情况下仅产生极少伪影。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。