Skip to main content
QUICK REVIEW

[论文解读] Deep Implicit Volume Compression

Danhang Tang, Saurabh Singh|arXiv (Cornell University)|May 18, 2020
Advanced Vision and Imaging参考文献 60被引用 5
一句话总结

本文提出了一种基于深度学习的压缩框架,用于4D体素数据中的截断符号距离场(TSDF)及其相关纹理,采用端到端可训练的基于块的神经网络,结合熵编码与无损符号压缩。与最先进方法相比,该方法在保持几何与纹理保真度的同时,实现了66%的比特率降低或50%的失真降低,通过时空一致的纹理参数化方法提升了重建质量。

ABSTRACT

We describe a novel approach for compressing truncated signed distance fields (TSDF) stored in 3D voxel grids, and their corresponding textures. To compress the TSDF, our method relies on a block-based neural network architecture trained end-to-end, achieving state-of-the-art rate-distortion trade-off. To prevent topological errors, we losslessly compress the signs of the TSDF, which also upper bounds the reconstruction error by the voxel size. To compress the corresponding texture, we designed a fast block-based UV parameterization, generating coherent texture maps that can be effectively compressed using existing video compression algorithms. We demonstrate the performance of our algorithms on two 4D performance capture datasets, reducing bitrate by 66% for the same distortion, or alternatively reducing the distortion by 50% for the same bitrate, compared to the state-of-the-art.

研究动机与目标

  • 解决AR/VR与自由视角视频应用中4D体素重建带来的高内存占用问题。
  • 在现有方法(如Tang等人[59]和Draco)的基础上,进一步提升压缩TSDF体素的率失真性能。
  • 通过无损压缩TSDF符号,将重建误差限制在体素尺寸范围内,并保持拓扑正确性。
  • 设计一种纹理参数化方法,确保时空一致性,同时无需压缩UV坐标。
  • 将几何与纹理压缩整合为统一的、端到端可训练系统,用于4D性能捕捉。

提出的方法

  • 使用基于块的3D卷积自编码器结合学习到的熵建模,实现TSDF体素的端到端压缩。
  • 采用条件先验分布 $ p_{\mathbf{s}|\hat{\mathbf{z}}} $ 对TSDF符号进行无损压缩,确保重建误差被限制在体素尺寸范围内。
  • 提出一种新型基于块的UV参数化方法,利用Morton打包的图块,提升纹理图的时空一致性。
  • 对一致的纹理图应用标准视频编码器(如H.264),避免单独的UV坐标压缩。
  • 使用面向表面的失真损失进行网络训练,强调等值面附近的误差。
  • 采用联合压缩流水线,编码器输出量化码字 $ \hat{\mathbf{z}} $,解码器重建 $ \hat{\mathbf{x}} = \mathbf{s} \odot |\mathcal{D}(\hat{\mathbf{z}})| $。

实验结果

研究问题

  • RQ1学习到的、端到端的压缩模型是否能在4D TSDF数据上实现优于现有方法的率失真性能?
  • RQ2TSDF符号的无损压缩如何影响重建误差与拓扑保真度?
  • RQ3基于块的纹理参数化结合Morton打包是否能在不追踪或传输UV坐标的情况下提升压缩效率?
  • RQ4当使用标准视频编码器时,纹理图的时空一致性在多大程度上降低了比特率?
  • RQ5将几何与纹理压缩整合到单一流水线中,是否能实现优于独立处理的整体性能?

主要发现

  • 与Tang等人[59]的最先进方法相比,该方法在相同失真水平下实现了66%的比特率降低。
  • 在相同比特率下,所提方法相比Tang等人[59]将失真降低了50%,证明了其优越的率失真性能。
  • TSDF符号的无损压缩将重建误差限制在体素尺寸范围内,并确保了重建表面的拓扑正确性。
  • 所提出的纹理参数化方法在每个体素平均达到350 KB的码率,PSNR为30.9,压缩效率优于UVAtlas[71]和朴素的分块打包基线方法。
  • 该方法保持了高视觉质量,在低比特率下渲染纹理也无可见伪影,如定性对比所示。
  • 系统在单张GPU上实现了20ms的端到端推理时间,展示了其在实时应用中的实际效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。