Skip to main content
QUICK REVIEW

[论文解读] VoxelContext-Net: An Octree based Framework for Point Cloud Compression

Zizheng Que, Guo Lu|arXiv (Cornell University)|May 5, 2021
3D Shape Modeling and Analysis参考文献 37被引用 12
一句话总结

VoxelContext-Net 是一种基于八叉树的新型深度学习框架,用于三维点云压缩,通过利用局部体素上下文来增强熵建模并提高重建质量。通过整合来自相邻体素的空间上下文并应用坐标精炼模块,该方法在静态(ScanNet)和动态(Semantic KITTI)点云数据集上均实现了最先进的压缩性能,相较于 G-PCC 和 OctSqueeze 等先前方法,在比特率降低和下游任务准确率方面表现更优。

ABSTRACT

In this paper, we propose a two-stage deep learning framework called VoxelContext-Net for both static and dynamic point cloud compression. Taking advantages of both octree based methods and voxel based schemes, our approach employs the voxel context to compress the octree structured data. Specifically, we first extract the local voxel representation that encodes the spatial neighbouring context information for each node in the constructed octree. Then, in the entropy coding stage, we propose a voxel context based deep entropy model to compress the symbols of non-leaf nodes in a lossless way. Furthermore, for dynamic point cloud compression, we additionally introduce the local voxel representations from the temporal neighbouring point clouds to exploit temporal dependency. More importantly, to alleviate the distortion from the octree construction procedure, we propose a voxel context based 3D coordinate refinement method to produce more accurate reconstructed point cloud at the decoder side, which is applicable to both static and dynamic point cloud compression. The comprehensive experiments on both static and dynamic point cloud benchmark datasets(e.g., ScanNet and Semantic KITTI) clearly demonstrate the effectiveness of our newly proposed method VoxelContext-Net for 3D point cloud geometry compression.

研究动机与目标

  • 为解决现有基于八叉树和体素的点云压缩方法在建模空间依赖性和降低重建失真方面的局限性。
  • 开发一种统一框架,适用于静态与动态点云压缩,通过利用局部空间上下文以提升熵建模性能。
  • 通过在解码器端引入坐标精炼方法,减少八叉树构建带来的失真,实现更精确的三维点云重建。
  • 通过利用相邻帧中的共位体素表示,探索动态点云中的时间依赖性,以提升压缩效率。

提出的方法

  • 该方法将输入点云组织为八叉树结构,其中每个非叶节点符号表示其八个子节点的占用状态。
  • 为每个节点计算大小为 $9\times9\times9$ 的局部体素表示,以编码同深度层级下相邻节点的空间上下文。
  • 训练一个深度熵模型,利用局部体素上下文作为上下文建模输入,对八叉树节点符号进行无损压缩。
  • 对于动态点云,通过引入前一帧和后一帧的体素表示,将时间上下文纳入模型,以建模运动与时间冗余性。
  • 在解码器端应用基于体素上下文的坐标精炼模块,以更准确地重建叶节点的三维坐标,降低几何失真。
  • 该框架端到端可训练,整合了熵编码与重建阶段,以优化整体压缩性能。

实验结果

研究问题

  • RQ1来自同深度层级相邻节点的局部体素上下文是否能提升八叉树结构点云压缩中的熵建模性能?
  • RQ2在动态点云中,引入相邻帧的时间体素上下文在多大程度上能提升压缩效率?
  • RQ3基于局部体素上下文的坐标精炼模块是否能降低重建点云中的几何失真?
  • RQ4在基准数据集上,该方法相较于手工设计与学习型基线方法,在比特率与重建质量方面优越程度如何?
  • RQ5重建点云的质量在多大程度上影响下游任务(如目标检测与语义分割)的性能?

主要发现

  • 在 ScanNet 数据集上,VoxelContext-Net 相较于 G-PCC 实现了 43.66% 的比特率降低,显著优于基线方法。
  • 在 Semantic KITTI 数据集上,该方法相较 G-PCC 实现 31.15% 的比特率降低,相较 OctSqueeze 实现 38.10% 的比特率降低,适用于动态压缩。
  • 使用 $9\times9\times9$ 局部体素表示在压缩增益与计算成本之间实现了最优平衡,相较于 $5\times5\times5$ 表示,在深度 9 时比特率提升 2.5%。
  • VoxelContext-Net 的解码时间在 ScanNet 上为 49–109ms,在 KITTI 上为 52–90ms,快于 G-PCC 但略慢于 OctSqueeze,同时实现了更优的压缩性能。
  • 在低比特率下,使用 VoxelContext-Net 重建的点云进行目标检测与语义分割任务时,mAP 和 IOU 分数更高,表现更优。
  • 坐标精炼模块显著提升了重建精度,从而在压缩性能与下游任务中均取得更优表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。