Skip to main content
QUICK REVIEW

[论文解读] Periodic Vibration Gaussian: Dynamic Urban Scene Reconstruction and Real-time Rendering

Yu-Rui Chen, Chun Gu|arXiv (Cornell University)|Nov 30, 2023
Remote Sensing and Land Use被引用 4
一句话总结

该论文提出周期性振动高斯分布(PVG),一种基于3D高斯溅射的统一方法,通过将基于周期性振动的时间动态嵌入静态高斯点中,实现对动态城市场景的建模,无需对象级标注即可实现实时渲染和优越的重建效果。PVG的训练速度比SUDS快50倍,渲染速度快6000倍,在Waymo和KITTI基准测试中显著优于当前最先进方法,PSNR、SSIM和LPIPS指标均有显著提升。

ABSTRACT

Modeling dynamic, large-scale urban scenes is challenging due to their highly intricate geometric structures and unconstrained dynamics in both space and time. Prior methods often employ high-level architectural priors, separating static and dynamic elements, resulting in suboptimal capture of their synergistic interactions. To address this challenge, we present a unified representation model, called Periodic Vibration Gaussian (PVG). PVG builds upon the efficient 3D Gaussian splatting technique, originally designed for static scene representation, by introducing periodic vibration-based temporal dynamics. This innovation enables PVG to elegantly and uniformly represent the characteristics of various objects and elements in dynamic urban scenes. To enhance temporally coherent and large scene representation learning with sparse training data, we introduce a novel temporal smoothing mechanism and a position-aware adaptive control strategy respectively. Extensive experiments on Waymo Open Dataset and KITTI benchmarks demonstrate that PVG surpasses state-of-the-art alternatives in both reconstruction and novel view synthesis for both dynamic and static scenes. Notably, PVG achieves this without relying on manually labeled object bounding boxes or expensive optical flow estimation. Moreover, PVG exhibits 900-fold acceleration in rendering over the best alternative.

研究动机与目标

  • 解决大规模、高度动态城市场景中复杂时空交互关系的重建挑战。
  • 克服先前基于NeRF的方法依赖昂贵监督(如3D边界框、光流)或训练与渲染速度缓慢的局限性。
  • 在无需显式对象分解的情况下,统一静态与动态元素的表示形式,形成单一高效公式。
  • 通过新型基于光流的平滑化与自适应控制策略,在稀疏训练数据下提升重建的时序一致性。
  • 在显著加速训练与渲染的同时,实现最先进的新视角合成性能。

提出的方法

  • 通过引入基于周期性振动的时间可变高斯位置,扩展3D高斯溅射:$\widetilde{\bm{\mu}}(t) = \bm{\mu} + \mathbf{A} \sin\left(\frac{2\pi t}{l}\right)$,其中$l$控制周期长度,$\mathbf{A}$编码运动幅度与方向。
  • 引入基于场景光流的时序平滑机制,以增强运动一致性并减少新视角合成中的闪烁现象。
  • 采用位置感知的自适应控制策略,稳定在无界城市场景中(尤其是远距离区域)的点行为。
  • 引入多种损失项:深度损失$\mathcal{L}_d$、速度损失$\mathcal{L}_{\bm{v}}$、不透明度损失$\mathcal{L}_o$,以及天空优化,以提升几何与外观质量。
  • 利用LiDAR监督与新颖的时间依赖不透明度衰减机制,增强重建保真度与动态元素的分离效果。
  • 采用隐式场景光流估计,无需真实光流或人工标注。

实验结果

研究问题

  • RQ1是否能够通过统一的3D高斯溅射公式,在无需显式对象级分解的前提下,有效表示大规模城市场景中的静态与动态元素?
  • RQ2在训练数据稀疏的情况下,如何提升动态场景重建的时序一致性?
  • RQ3周期性振动动态是否能优于线性或静止运动模型,更有效地捕捉城市场景中多样的运动模式?
  • RQ4基于光流的时序平滑机制在多大程度上可减少闪烁现象并提升渲染一致性?
  • RQ5所提方法是否能在显著加速训练与渲染的同时,实现最先进的新视角合成性能,相较基于NeRF的替代方案?

主要发现

  • 在KITTI基准测试中,PVG相较SOTA基线SUDS实现PSNR提升11.4%、SSIM提升5.8%,LPIPS降低55.1%。
  • 在Waymo开放数据集上,PVG相较Mars基线实现PSNR提升9.9%、SSIM提升4.7%,LPIPS降低20.6%。
  • 与最佳基线SUDS相比,PVG实现训练速度提升50倍,渲染速度提升6000倍。
  • 消融研究证实,基于场景光流的时序平滑机制显著提升了渲染平滑度与时序一致性,启用后PSNR从27.77提升至28.11。
  • 最优周期长度$l$至关重要:过短导致动态表示不佳,过长则在静态区域引发鬼影现象;模型在中等$l$值下表现最佳。
  • 位置感知自适应控制策略显著改善远距离视角的重建效果,而速度损失有助于更清晰地区分动态与静态成分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。