Skip to main content
QUICK REVIEW

[论文解读] Masked Space-Time Hash Encoding for Efficient Dynamic Scene Reconstruction

Feng Wang, Zilong Chen|arXiv (Cornell University)|Oct 26, 2023
Advanced Vision and Imaging被引用 4
一句话总结

本文提出了一种新型的掩码时空哈希编码(MSTH),通过可学习的掩码动态加权3D哈希编码与4D哈希编码,基于不确定性驱动的时空动态特性,实现高效的动态3D场景重建。通过减少静态区域中冗余的4D哈希表查询,MSTH仅用20分钟训练时间和130 MB内存,便实现了最先进的渲染质量,显著优于以往方法在速度、内存效率和重建保真度方面的表现。

ABSTRACT

In this paper, we propose the Masked Space-Time Hash encoding (MSTH), a novel method for efficiently reconstructing dynamic 3D scenes from multi-view or monocular videos. Based on the observation that dynamic scenes often contain substantial static areas that result in redundancy in storage and computations, MSTH represents a dynamic scene as a weighted combination of a 3D hash encoding and a 4D hash encoding. The weights for the two components are represented by a learnable mask which is guided by an uncertainty-based objective to reflect the spatial and temporal importance of each 3D position. With this design, our method can reduce the hash collision rate by avoiding redundant queries and modifications on static areas, making it feasible to represent a large number of space-time voxels by hash tables with small size.Besides, without the requirements to fit the large numbers of temporally redundant features independently, our method is easier to optimize and converge rapidly with only twenty minutes of training for a 300-frame dynamic scene.As a result, MSTH obtains consistently better results than previous methods with only 20 minutes of training time and 130 MB of memory storage. Code is available at https://github.com/masked-spacetime-hashing/msth

研究动机与目标

  • 为解决4D哈希编码在动态场景重建中因时间冗余导致的高计算与内存开销问题。
  • 通过解耦静态与动态场景组件,提升渲染质量与优化效率。
  • 通过避免在静态区域进行冗余更新,减少4D表示中的哈希冲突。
  • 在无需大量超参数调优的情况下,实现快速收敛——仅用20分钟训练即达到最先进性能。
  • 通过新采集的多视角视频数据集,验证方法在真实复杂动态场景中的鲁棒性。

提出的方法

  • MSTH将动态场景表示为3D哈希编码(用于静态成分)与4D哈希编码(用于动态成分)的加权组合,权重通过可微分的3D掩码学习得到。
  • 掩码由基于不确定性的目标引导,该目标源自Kendall与Gal(2017)的贝叶斯框架,用于估计每个3D点为静态的概率。
  • 通过最大化不确定估计与掩码之间的互信息,确保低不确定度(静态)区域主要由3D哈希表编码。
  • 通过在静态区域为动态成分分配低权重,MSTH减少4D哈希表的冲突,并避免冗余的特征存储与更新。
  • 4D哈希表大小与3D表相当,从而在不损失重建质量的前提下实现紧凑表示。
  • 模型通过多视角或单目视频输入端到端训练,使用辐射场损失优化视图合成。

实验结果

研究问题

  • RQ1与纯4D编码相比,采用可学习掩码的混合3D+4D哈希编码是否能更高效且高质量地实现动态场景重建?
  • RQ2不确定性估计在动态分配静态与动态成分表示方面是否具有高效引导能力?
  • RQ3与现有方法相比,MSTH能否在显著减少训练时间与内存使用的情况下实现最先进性能?
  • RQ4在具有大范围静态区域与复杂运动的现实世界复杂动态场景中,该方法表现如何?
  • RQ5不确定性引导的掩码在多大程度上减少了哈希冲突并提升了优化稳定性?

主要发现

  • 在Google Immersive数据集上,MSTH的PSNR达到29.6,在D-NeRF数据集上达到31.34,优于所有先前方法,包括NeRFPlayer、HyperReel与HexPlane。
  • 在相同基准上,MSTH将训练时间缩短至仅20分钟,而NeRFPlayer为6小时,HyperReel为2.7小时。
  • 与基于加法的消融实验相比,MSTH在D-NeRF数据集上的LPIPS降低0.02(提升20%),表明感知质量更优。
  • 在定性对比中,MSTH比最先进方法更准确地重建了细微运动细节,如面部特征、飞溅火花与条纹纹理。
  • 不确定性引导的掩码使分布更清晰、更少噪声,有助于更好分离静态与动态区域,减少哈希冲突。
  • 该方法在新采集的Campus数据集中的挑战性场景中仍保持高性能,PSNR为20.9,SSIM为0.722,证明了其在真实场景下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。