Skip to main content
QUICK REVIEW

[論文レビュー] VoxelContext-Net: An Octree based Framework for Point Cloud Compression

Zizheng Que, Guo Lu|arXiv (Cornell University)|May 5, 2021
3D Shape Modeling and Analysis参考文献 37被引用数 12
ひとこと要約

VoxelContext-Net は、局所的なボクセルコンテキストを活用してエントロピーモデリングを向上させ、再構築品質を向上させる、3次元ポイントクラウド圧縮のための新しいオクトリーベースのディープラーニングフレームワークです。隣接するボクセルからの空間的コンテキストを統合し、座標リファインメントモジュールを適用することで、静的(ScanNet)および動的(Semantic KITTI)なポイントクラウドデータセットにおいて、G-PCC や OctSqueeze などの先行手法を上回る圧縮性能を達成し、ビットレート低減と下流タスクの精度向上を実現しました。

ABSTRACT

In this paper, we propose a two-stage deep learning framework called VoxelContext-Net for both static and dynamic point cloud compression. Taking advantages of both octree based methods and voxel based schemes, our approach employs the voxel context to compress the octree structured data. Specifically, we first extract the local voxel representation that encodes the spatial neighbouring context information for each node in the constructed octree. Then, in the entropy coding stage, we propose a voxel context based deep entropy model to compress the symbols of non-leaf nodes in a lossless way. Furthermore, for dynamic point cloud compression, we additionally introduce the local voxel representations from the temporal neighbouring point clouds to exploit temporal dependency. More importantly, to alleviate the distortion from the octree construction procedure, we propose a voxel context based 3D coordinate refinement method to produce more accurate reconstructed point cloud at the decoder side, which is applicable to both static and dynamic point cloud compression. The comprehensive experiments on both static and dynamic point cloud benchmark datasets(e.g., ScanNet and Semantic KITTI) clearly demonstrate the effectiveness of our newly proposed method VoxelContext-Net for 3D point cloud geometry compression.

研究の動機と目的

  • 既存のオクトリーベースおよびボクセルベースのポイントクラウド圧縮手法の限界、特に空間的依存関係のモデリングと再構築歪みの低減の点で課題を解決すること。
  • 静的および動的ポイントクラウド圧縮に適用可能な統合フレームワークを構築し、局所的な空間的コンテキストを活用してエントロピーモデリングを改善すること。
  • オクトリー構築に起因する歪みを低減するため、再構築の精度を高めるためにデコーダーに座標リファインメント手法を導入すること。
  • 隣接フレームからの同一位置のボクセル表現を活用して、動的ポイントクラウドにおける時間的依存関係を効果的にモデル化し、圧縮効率を向上させること。

提案手法

  • 入力ポイントクラウドをオクトリー構造に整列させ、非リーフノードの各符号はその8つの子ノードの占有状態を表す。
  • 各ノードに対して、同じ深さレベルの隣接ノードからの空間的コンテキストを符号化するため、サイズ $9\times9\times9$ の局所的ボクセル表現を計算する。
  • 局所的ボクセルコンテキストを入力として用いて、深層エントロピーモデルを訓練し、オクトリーノード符号の無損失圧縮を実現する。
  • 動的ポイントクラウドの場合、時間的コンテキストを導入するために、直前および直後のフレームからのボクセル表現を含め、動きと時間的冗長性をモデリングする。
  • デコーダーにボクセルコンテキストに基づく座標リファインメントモジュールを適用し、リーフノードの3次元座標をより正確に再構築することで、幾何的歪みを低減する。
  • エンドツーエンドで学習可能なフレームワークであり、エントロピー符号化と再構築ステージを統合して、圧縮性能を最適化する。

実験結果

リサーチクエスチョン

  • RQ1同じ深さレベルの隣接ノードからの局所的ボクセルコンテキストは、オクトリー構造のポイントクラウド圧縮におけるエントロピーモデリングを向上させることができるか?
  • RQ2隣接フレームからの時間的ボクセルコンテキストを統合することで、動的ポイントクラウドの圧縮効率はどのように向上するか?
  • RQ3局所的ボクセルコンテキストに基づく座標リファインメントモジュールは、再構築されたポイントクラウドの幾何的歪みを低減できるか?
  • RQ4提案手法は、ベンチマークデータセットにおいて、手作業設計および学習ベースのベースラインと比較して、ビットレートおよび再構築品質の点でどの程度優れているか?
  • RQ5再構築されたポイントクラウドの品質は、物体検出やセマンティックセグメンテーションなどの下流タスクにどのように影響を与えるか?

主な発見

  • ScanNet データセットでは、G-PCC と比較してビットレートを 43.66% 減少させ、ベースライン手法を顕著に上回りました。
  • Semantic KITTI データセットでは、動的圧縮において G-PCC と比較して 31.15%、OctSqueeze と比較して 38.10% のビットレート低減を達成しました。
  • サイズ $9\times9\times9$ の局所的ボクセル表現は、圧縮効果と計算コストの最適なトレードオフを実現し、深さ9において $5\times5\times5$ の表現と比較してビットレートを 2.5% さらに改善しました。
  • ScanNet ではデコーダー処理時間が 49–109ms、KITTI では 52–90ms であり、G-PCC よりも高速で、OctSqueeze よりわずかに遅いものの、優れた圧縮性能を達成しています。
  • 物体検出やセマンティックセグメンテーションなどの下流タスクでは、VoxelContext-Net から得られる再構築ポイントクラウドを用いることで、特に低ビットレート条件下で mAP および IOU スコアが向上しました。
  • 座標リファインメントモジュールは再構築精度を顕著に向上させ、圧縮性能および下流タスク性能の両面で優れた結果をもたらしました。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。