[论文解读] Sparse Tensor-based Multiscale Representation for Point Cloud Geometry Compression
该论文提出了一种统一的、低复杂度的点云几何压缩方法——SparsePCGC,采用多尺度稀疏张量表示和基于稀疏卷积的神经网络。通过聚焦于最可能被占据的体素(MP-POVs),并利用基于稀疏CNN的占用概率近似(SOPA)模型,对跨尺度和同尺度的相关性进行建模,该方法在包括密集点云(8iVFB、Owlii、MUVB)和稀疏点云(KITTI、Ford)在内的多种数据集上,均实现了无损和有损模式下的最先进压缩性能。
This study develops a unified Point Cloud Geometry (PCG) compression method through the processing of multiscale sparse tensor-based voxelized PCG. We call this compression method SparsePCGC. The proposed SparsePCGC is a low complexity solution because it only performs the convolutions on sparsely-distributed Most-Probable Positively-Occupied Voxels (MP-POV). The multiscale representation also allows us to compress scale-wise MP-POVs by exploiting cross-scale and same-scale correlations extensively and flexibly. The overall compression efficiency highly depends on the accuracy of estimated occupancy probability for each MP-POV. Thus, we first design the Sparse Convolution-based Neural Network (SparseCNN) which stacks sparse convolutions and voxel sampling to best characterize and embed spatial correlations. We then develop the SparseCNN-based Occupancy Probability Approximation (SOPA) model to estimate the occupancy probability either in a single-stage manner only using the cross-scale correlation, or in a multi-stage manner by exploiting stage-wise correlation among same-scale neighbors. Besides, we also suggest the SparseCNN based Local Neighborhood Embedding (SLNE) to aggregate local variations as spatial priors in feature attribute to improve the SOPA. Our unified approach not only shows state-of-the-art performance in both lossless and lossy compression modes across a variety of datasets including the dense object PCGs (8iVFB, Owlii, MUVB) and sparse LiDAR PCGs (KITTI, Ford) when compared with standardized MPEG G-PCC and other prevalent learning-based schemes, but also has low complexity which is attractive to practical applications.
研究动机与目标
- 为高效压缩具有不同密度和特性的非结构化、稀疏分布的3D点云提供解决方案。
- 通过使用深度学习建模占用概率,挖掘不规则分布点之间的空间相关性。
- 开发一种统一的压缩框架,使其在多种点云类型中均能有效实现无损和有损压缩。
- 通过仅在相关且被正向占据的体素(MP-POVs)上应用稀疏卷积,降低计算复杂度。
- 通过捕捉跨尺度和同尺度空间先验的多尺度表示,提升压缩效率。
提出的方法
- 该方法使用多尺度稀疏张量表示,将点云几何下采样并重采样为分层体素网格。
- 将最可能被占据的体素(MP-POVs)作为压缩的主要目标,将计算仅限制在这些活跃体素上。
- 设计了一种基于稀疏卷积的神经网络(SparseCNN),通过稀疏卷积提取空间特征并建模局部邻域变化。
- 基于稀疏CNN的占用概率近似(SOPA)模型,通过单阶段(跨尺度)或多阶段(同尺度邻居)相关性建模来估计占用概率。
- 局部邻域嵌入(SLNE)模块通过聚合局部空间变化作为先验,增强特征表示,从而提升概率估计性能。
- 该模型架构在各尺度间共享,减少参数存储,并支持无损和有损压缩模式下的高效推理。

实验结果
研究问题
- RQ1如何有效建模不规则分布的3D点云中的空间相关性,以提升压缩效率?
- RQ2统一的基于深度学习的压缩框架是否能在多种点云类型中同时实现无损和有损模式下的最先进性能?
- RQ3稀疏卷积和多尺度表示在保持高比特率压缩增益的同时,能在多大程度上降低计算复杂度?
- RQ4跨尺度与同尺度相关性建模的融合,如何提升点云几何压缩中的占用概率估计性能?
- RQ5在各尺度间共享单一模型架构,是否能以极低的参数开销实现高效率压缩?
主要发现
- SparsePCGC在多个数据集上实现了最先进的压缩性能,包括密集点云(8iVFB、Owlii、MUVB)和稀疏点云(KITTI、Ford),优于MPEG G-PCC及其他基于学习的方法。
- 在无损压缩中,该方法仅使用4.9 MB模型参数(8阶段SOPA),可高效处理密集和稀疏点云。
- 在有损压缩中,该方法对密集点云使用5.8 MB(SLNE增强)和0.85 MB(单阶段)的SOPA模型,对稀疏LiDAR数据分别使用21.7 MB和31.6 MB的模型。
- 该方法保持了低计算复杂度,编码和解码时间均约为每点云1–2秒,优于OctAttention,且解码速度约为G-PCC版本14的两倍。
- 即使在使用相同的CRM后处理模块时,所提出的SOPA模型在BD-RATE指标上仍显著优于VCN和OctAttention,展现出优异的鲁棒性和泛化能力。
- 通过使用稀疏卷积和多尺度表示,有效利用了空间先验,显著提升了占用概率估计精度,并减少了比特流大小。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。