[论文解读] Neural Scene Flow Fields for Space-Time View Synthesis of Dynamic Scenes
这篇论文提出了 Neural Scene Flow Fields,一种用于单目视频的时变神经表示,联合建模外观、几何和三维场景运动,以在时空中合成新视图。
We present a method to perform novel view and time synthesis of dynamic scenes, requiring only a monocular video with known camera poses as input. To do this, we introduce Neural Scene Flow Fields, a new representation that models the dynamic scene as a time-variant continuous function of appearance, geometry, and 3D scene motion. Our representation is optimized through a neural network to fit the observed input views. We show that our representation can be used for complex dynamic scenes, including thin structures, view-dependent effects, and natural degrees of motion. We conduct a number of experiments that demonstrate our approach significantly outperforms recent monocular view synthesis methods, and show qualitative results of space-time view synthesis on a variety of real-world videos.
研究动机与目标
- 动机:从具有已知相机位的单目视频实现新视图合成和时间插值。
- 目标:将动态场景建模为关于空间和时间的连续函数,包含三维运动(场景流)以及外观/密度。
- 目的:在处理可见性恢复和运动边界的同时,优化神经表示以拟合输入视图。
提出的方法
- 将动态场景表示为 Neural Scene Flow Fields,输出颜色、密度、正向和反向三维场景流,以及消差(disocclusion)权重。
- 使用时间扩展的 MLP 将 (x, d, i) 映射到 (c, sigma, F_i, W_i)。
- 通过将相邻时间视图通过预测的场景流扭曲到目标时间来优化时域光度一致性损失。
- 引入消差权重以处理运动边界,并对场景流应用 L1 正则化和循环一致性。
- 用一个学习得到的混合权重 v 将动态与静态场景表示结合,以在静态区域改善渲染。
- 通过基于 splatting 的平面扫描体积渲染实现时空插值,该渲染使用预测的光流对时间 i 与 i+1 进行混合。
- 对每个场景进行训练,使用 COLMAP 推导的相机参数,初始化的可选数据驱动先验,以及包括数据先验和几何一致性在内的多项损失。
实验结果
研究问题
- RQ1在已知相机姿态的单目视频下,是否能够合成动态场景的新视图和新时间?
- RQ2相比静态或仅基于视图的方法,神经的、密集的三维场景流场是否能更好地捕捉运动边界和消差?
- RQ3将静态与动态场景表示结合,是否在静态区域提高渲染质量,同时保留动态保真度?
- RQ4是否可以通过预测的三维场景流和 splatted 渲染来实现时间插值,而不是简单的帧混合?
主要发现
- 所提出的动态表示在 Nvidia Dynamic Scenes 数据集上对新视图合成和联合视图-时间合成,超越了单目和多视图基线的最新方法。
- 增加静态场景分量能提高渲染质量,特别是在静态区域,在某些设置中提升高达约30%。
- 在消融实验中,包含静态集成与所有损失的完整模型在动态与全场景评估中获得最佳的 SSIM/PSNR/LPIPS。
- 基于场景流扭曲的时空渲染在中间时间的结果优于简单的二维帧插值或纯静态方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。