Skip to main content
QUICK REVIEW

[论文解读] Dynamic 3D Gaussians: Tracking by Persistent Dynamic View Synthesis

Jonathon Luiten, Georgios Kopanas|arXiv (Cornell University)|Aug 18, 2023
Advanced Vision and Imaging被引用 5
一句话总结

本文提出动态3D高斯分布,一种新颖方法,可在动态场景中实现同时的6-DOF稠密跟踪与照片级真实感新视角合成。通过将场景元素建模为具有固定颜色、不透明度和大小的运动、旋转且持久的3D高斯分布,该方法结合可微渲染与物理先验(如局部刚性与等距性),实现了精确的度量跟踪(平均3D误差2.21厘米)与实时渲染(850 FPS),且无需光学流或对应关系输入。

ABSTRACT

We present a method that simultaneously addresses the tasks of dynamic scene novel-view synthesis and six degree-of-freedom (6-DOF) tracking of all dense scene elements. We follow an analysis-by-synthesis framework, inspired by recent work that models scenes as a collection of 3D Gaussians which are optimized to reconstruct input images via differentiable rendering. To model dynamic scenes, we allow Gaussians to move and rotate over time while enforcing that they have persistent color, opacity, and size. By regularizing Gaussians' motion and rotation with local-rigidity constraints, we show that our Dynamic 3D Gaussians correctly model the same area of physical space over time, including the rotation of that space. Dense 6-DOF tracking and dynamic reconstruction emerges naturally from persistent dynamic view synthesis, without requiring any correspondence or flow as input. We demonstrate a large number of downstream applications enabled by our representation, including first-person view synthesis, dynamic compositional scene synthesis, and 4D video editing.

研究动机与目标

  • 在不依赖光学流或对应关系输入的前提下,实现对动态场景中所有场景元素的稠密、长期6-DOF跟踪。
  • 利用持久的3D表示,实现高保真、照片级真实感的动态场景新视角合成。
  • 开发一种可扩展的实时方法,用于动态3D重建,支持下游编辑与可视化任务。
  • 通过运动正则化与空间一致性先验,将物理合理性整合到基于粒子的3D表示中。
  • 证明端到端可微优化在完整6-DOF运动恢复的动态场景建模中的可行性。

提出的方法

  • 该方法将动态场景表示为一组随时间变化位置与方向的3D高斯分布,而颜色、不透明度与大小保持固定,以确保持久性。
  • 利用可微渲染通过图像重建损失优化高斯参数,实现从多视角视频端到端训练。
  • 局部刚性、旋转相似性与长期等距性先验对运动进行正则化,确保局部区域运动的物理合理性与一致性。
  • 背景分割损失与时间步初始化的前向传播提升了重建稳定性与时间一致性。
  • 该方法采用基于粒子的拉格朗日表示,允许对高斯分布独立操作,以支持编辑与相机附着。
  • 所有组件在分析-合成框架中联合优化,使得跟踪自然地从精确的场景建模中涌现。

实验结果

研究问题

  • RQ1持久的、基于粒子的3D表示是否能够在无需光学流或对应关系输入的前提下,实现对所有场景元素的精确6-DOF跟踪?
  • RQ2对运动3D高斯分布的可微渲染是否能够在动态场景中实现高保真、照片级真实感的新视角合成?
  • RQ3物理先验(如局部刚性与等距性)在稳定运动估计与提升重建质量方面的有效性如何?
  • RQ4该表示是否能够支持复杂编辑任务,如第一人称视角合成与动态物体插入?
  • RQ5该方法在高分辨率、多相机动态序列上的实时训练与渲染方面,扩展性如何?

主要发现

  • 在150个时间步与27个训练相机下,该方法在动态新视角渲染中达到28.7 PSNR,推理速度达850 FPS,实现实时性能。
  • 在150个时间步内,平均3D跟踪误差仅为2.21厘米,相比之前最先进方法提升10倍。
  • 2D跟踪指标的归一化像素误差为1.57,显著优于先前方法。
  • 该方法实现了完整的6-DOF跟踪(包括旋转),支持将相机附着于动态高斯分布,实现第一人称或物体相对视角。
  • 消融实验表明,刚性损失、背景分割与参数固定对高质量跟踪与视角合成至关重要。
  • 由于高斯分布的持久性与独立性,诸如徽标插入或物体添加等编辑操作可自然地传播至所有时间步。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。