Skip to main content
QUICK REVIEW

[论文解读] Spacetime Gaussian Feature Splatting for Real-Time Dynamic View Synthesis

Zhan Li, Zhang Chen|arXiv (Cornell University)|Dec 28, 2023
Advanced Vision and Imaging被引用 6
一句话总结

本文提出时空高斯特征点渲染(Spacetime Gaussian Feature Splatting),一种新颖的动态场景表现场景表示方法,通过在3D高斯基础上引入时变不透明度、运动与旋转参数,实现对静态、动态及瞬态内容的联合建模。通过用可学习的神经特征替代球谐函数,并结合误差与深度引导的高斯采样策略,该方法在NVIDIA RTX 4090显卡上实现了8K分辨率下60 FPS的实时渲染,且模型参数量紧凑,达到当前最先进水平。

ABSTRACT

Novel view synthesis of dynamic scenes has been an intriguing yet challenging problem. Despite recent advancements, simultaneously achieving high-resolution photorealistic results, real-time rendering, and compact storage remains a formidable task. To address these challenges, we propose Spacetime Gaussian Feature Splatting as a novel dynamic scene representation, composed of three pivotal components. First, we formulate expressive Spacetime Gaussians by enhancing 3D Gaussians with temporal opacity and parametric motion/rotation. This enables Spacetime Gaussians to capture static, dynamic, as well as transient content within a scene. Second, we introduce splatted feature rendering, which replaces spherical harmonics with neural features. These features facilitate the modeling of view- and time-dependent appearance while maintaining small size. Third, we leverage the guidance of training error and coarse depth to sample new Gaussians in areas that are challenging to converge with existing pipelines. Experiments on several established real-world datasets demonstrate that our method achieves state-of-the-art rendering quality and speed, while retaining compact storage. At 8K resolution, our lite-version model can render at 60 FPS on an Nvidia RTX 4090 GPU. Our code is available at https://github.com/oppo-us-research/SpacetimeGaussians.

研究动机与目标

  • 解决在保持模型存储紧凑的前提下,实现高分辨率、逼真、实时动态视图合成的挑战。
  • 克服基于网格的表示方法在建模复杂场景动态与瞬态内容方面的局限性。
  • 通过引导式高斯采样提升稀疏覆盖区域的渲染质量。
  • 利用紧凑的神经特征替代球谐函数,实现时间可变外观的高效、可微分渲染。

提出的方法

  • 通过引入时变不透明度、多项式运动与旋转参数,将3D高斯扩展为时空高斯(STGs),以建模动态与瞬态场景元素。
  • 在每个高斯上用可学习的神经特征替代球谐函数,以编码基础颜色、视角依赖与时间依赖的外观,提升表达能力并增强模型紧凑性。
  • 实现特征点渲染:将STG特征可微分地光栅化至图像平面,并通过小型MLP预测最终像素颜色。
  • 提出在4D时空空间中基于训练误差与粗略深度监督的高斯采样策略,以提升远距离或稀疏覆盖区域的收敛性。
  • 采用端到端可微分渲染流水线进行模型训练,优化光度一致性与深度一致性。
  • 利用粗略深度监督与误差图,优先在挑战性区域进行采样,从而在不增加模型大小的前提下提升渲染保真度。

实验结果

研究问题

  • RQ14D时空高斯表示能否同时有效建模静态、动态与瞬态场景内容?
  • RQ2用可学习的神经特征替代球谐函数是否能在动态场景中提升渲染质量并增强模型紧凑性?
  • RQ3基于训练误差与粗略深度的引导采样策略是否能显著改善稀疏覆盖区域的渲染质量?
  • RQ4所提方法能否在保持最先进质量与小模型尺寸的前提下,实现8K分辨率下的实时(60 FPS)渲染?
  • RQ5在真实世界动态数据集上,该方法在PSNR、LPIPS与推理速度方面与现有SOTA方法相比表现如何?

主要发现

  • 在Technicolor数据集上,该方法达到33.6的PSNR与0.084的LPIPS,优于DyNeRF与HyperReel等先前方法。
  • 在Google Immersive数据集上,该方法实现29.2的PSNR与0.042的LPIPS,两项指标均显著优于NeRFPlayer与HyperReel。
  • 轻量化版本模型在NVIDIA RTX 4090显卡上实现8K分辨率下60 FPS的渲染,验证了其实时性能。
  • 引导采样策略有效减少了远距离与稀疏覆盖区域的渲染伪影,定量与定性结果均显示DSSIM与LPIPS值更低。
  • 模型保持了紧凑的存储特性,全量版本在无需网格或体素表示的内存开销下实现了高保真渲染。
  • 通过神经特征实现的时空特征学习,能够准确建模视角与时间相关的外观变化,表现为感知质量提升与更低的感知误差指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。