[论文解读] Multiscale Point Cloud Geometry Compression
该论文提出了一种基于多尺度稀疏卷积的端到端学习框架,用于3D点云几何压缩,通过渐进式重采样分层重建几何结构。通过利用稀疏卷积的稀疏性,并将几何的无损八叉树压缩与特征的有学习能力的概率压缩分离,该方法在MPEG G-PCC上实现了超过70%的BD-Rate增益,在V-PCC上实现了40%的增益,同时显著降低了内存和计算成本。
Recent years have witnessed the growth of point cloud based applications because of its realistic and fine-grained representation of 3D objects and scenes. However, it is a challenging problem to compress sparse, unstructured, and high-precision 3D points for efficient communication. In this paper, leveraging the sparsity nature of point cloud, we propose a multiscale end-to-end learning framework which hierarchically reconstructs the 3D Point Cloud Geometry (PCG) via progressive re-sampling. The framework is developed on top of a sparse convolution based autoencoder for point cloud compression and reconstruction. For the input PCG which has only the binary occupancy attribute, our framework translates it to a downscaled point cloud at the bottleneck layer which possesses both geometry and associated feature attributes. Then, the geometric occupancy is losslessly compressed using an octree codec and the feature attributes are lossy compressed using a learned probabilistic context model.Compared to state-of-the-art Video-based Point Cloud Compression (V-PCC) and Geometry-based PCC (G-PCC) schemes standardized by the Moving Picture Experts Group (MPEG), our method achieves more than 40% and 70% BD-Rate (Bjontegaard Delta Rate) reduction, respectively. Its encoding runtime is comparable to that of G-PCC, which is only 1.5% of V-PCC.
研究动机与目标
- 解决在网络化应用中高效压缩稀疏、非结构化、高精度3D点云的挑战。
- 克服先前基于深度学习的方法中密集3D卷积效率低下、未能有效利用点云稀疏性的缺陷。
- 开发一种低复杂度、高效率的基于学习的压缩框架,平衡率失真性能与计算成本。
- 通过降低内存占用和运行时开销,实现深度学习驱动的点云压缩在实际中的部署。
提出的方法
- 采用基于稀疏卷积的自编码器处理以二值占用体素表示的输入点云几何结构。
- 实现渐进式多尺度重采样:在编码器中下采样,在解码器中上采样,以利用稀疏性并将局部几何结构嵌入特征表示中。
- 在瓶颈层,使用八叉树编码器对几何占用进行无损压缩,使用有学习能力的概率上下文模型对特征属性进行压缩。
- 使用二元交叉熵(BCE)损失,联合优化所有尺度下的比特率与重建失真。
- 采用自适应上下文建模,使用自回归先验(通过3D掩码卷积)或超先验(通过特征下采样)以提升率失真性能。
- 利用稀疏张量运算,与密集卷积方法相比,显著降低内存占用和浮点运算次数(FLOPs)。
实验结果
研究问题
- RQ1基于多尺度稀疏卷积的自编码器框架是否能在率失真性能上优于标准的V-PCC和G-PCC编码器?
- RQ2通过渐进式重采样和稀疏卷积,点云中的稀疏性在多大程度上可被利用以降低计算和内存成本?
- RQ3与最先进的有学习能力的压缩方法(如Learned-PCGC)相比,该方法在编码/解码复杂度和内存使用方面表现如何?
- RQ4采用自回归或超先验的自适应上下文建模是否能进一步提升压缩效率,同时不带来过高的计算开销?
主要发现
- 在标准测试序列上,该方法相较于MPEG G-PCC实现70.2%的BD-Rate降低,相较于V-PCC实现40.1%的BD-Rate降低。
- 与单尺度重建相比,该方法将内存使用量降低了约75%,计算速度提升了3倍。
- 编码和解码运行时间与G-PCC相当(在8iVFB上分别为1.58秒和5.40秒),远快于V-PCC(103.45秒),且仅需333 MB和1,273 MB的GPU内存。
- 模型仅使用778k参数(约3.2 MB),适合在资源受限设备上部署。
- 引入自回归先验可额外实现7.2%的BD-Rate降低,而超先验可实现4.14%的性能提升。
- 主观重建质量优于V-PCC和G-PCC,几何细节更清晰、更完整。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。