Skip to main content
QUICK REVIEW

[論文レビュー] Efficient LiDAR Point Cloud Geometry Compression Through Neighborhood Point Attention

Ruixiang Xue, Jianqiang Wang|arXiv (Cornell University)|Aug 26, 2022
3D Shape Modeling and Analysis被引用数 7
ひとこと要約

本稿では、固定受容 field を持つスパース畳み込みを、k-NN と自己注意機構を用いた学習可能で適応的な近隣集約に置き換えることで、LiDAR ポイントクラウドの幾何圧縮を向上させるためのネイバーヒッドポイントアテンション(NPA)を提案する。NPAFormer モデルは、SemanticKITTI および Ford データセットにおいて、損失あり圧縮で 17% 以上の BD-rate 優位を達成し、損失なしモードでは 14% 以上のビットレート低減を実現した。また、最先端手法と比較して復号時間を 640 倍短縮した。

ABSTRACT

Although convolutional representation of multiscale sparse tensor demonstrated its superior efficiency to accurately model the occupancy probability for the compression of geometry component of dense object point clouds, its capacity for representing sparse LiDAR point cloud geometry (PCG) was largely limited. This is because 1) fixed receptive field of the convolution cannot characterize extremely and unevenly distributed sparse LiDAR points very well; and 2) pretrained convolutions with fixed weights are insufficient to dynamically capture information conditioned on the input. This work therefore suggests the neighborhood point attention (NPA) to tackle them, where we first use k nearest neighbors (kNN) to construct adaptive local neighborhood; and then leverage the self-attention mechanism to dynamically aggregate information within this neighborhood. Such NPA is devised as a NPAFormer to best exploit cross-scale and same-scale correlations for geometric occupancy probability estimation. Compared with the anchor using standardized G-PCC, our method provides >17% BD-rate gains for lossy compression, and >14% bitrate reduction for lossless scenario using popular LiDAR point clouds in SemanticKITTI and Ford datasets. Compared with the state-of-the-art (SOTA) solution using attention optimized octree coding method, our approach requires much less decoding runtime with about 640 times speedup on average, while still presenting better compression efficiency.

研究の動機と目的

  • スパースで不均一に分布する LiDAR ポイントクラウドのモデリングにおいて、固定受容 field を持つスパース畳み込みの限界を克服すること。
  • 適応的近隣構造を用いて動的に局所相関を捉えることで、幾何的占有確率推定を改善すること。
  • 従来のアテンションベースおよび畳み込み手法と比較して、圧縮効率を維持または向上させながら復号複雑性を低減すること。
  • スパース LiDAR ポイントクラウドの損失ありおよび損失なし圧縮において、優れた性能を達成すること。

提案手法

  • 各点に対して k-NN を用いて適応的局所近隣を構築し、スパース畳み込みの固定受容 field の制限を克服する。
  • 各 k-NN 近隣内で自己注意機構を適用し、入力コンテンツに応じて特徴の寄与度を動的に重みづける。
  • NPAFormer を導入し、近隣特徴を集約し、マルチスケール スパーステンソルフレームワークに統合する。
  • x, y, z 軸に沿ったダイアディックダウンスケーリングを用いてマルチスケール表現を生成し、スケール間および同じスケール内の相関モデリングを可能にする。
  • PGM(確率生成モジュール)を採用し、NPAFormer とスパース畳み込み層をスタックして、各スケールでの占有確率を予測する。
  • オフセット加算を伴う階層的アップスケーリングを実行し、子オクタントを生成することで、スケーラブルかつマルチスケール圧縮を実現する。

実験結果

リサーチクエスチョン

  • RQ1k-NN と自己注意機構による適応的近隣集約は、スパース LiDAR ポイントクラウドの圧縮において、固定受容 field を持つスパース畳み込みを上回ることができるか?
  • RQ2提案された NPAFormer は、OctAttention や SparsePCGC といった既存の SOTA 手法と比較して、より高い圧縮効率を達成できるか?
  • RQ3復号複雑性をどれほど低減できるか、一方で高い圧縮利得を維持できるか?
  • RQ4近隣数(k)を変更した場合、圧縮比および精度の観点で性能にどのような影響を与えるか?
  • RQ5本手法は、スパース(SemanticKITTI, Ford)および密度の高い物体ポイントクラウドを含む、多様な LiDAR データセットに一般化可能か?

主な発見

  • 提案手法は、SemanticKITTI および Ford データセットにおいて、標準化された G-PCC と比較して、損失あり圧縮で 17% 以上の BD-rate 優位を達成した。
  • 損失なしモードではビットレートを 14% 以上低減し、SparsePCGC よりも約 10 パcentage ポints の優位性を示した。
  • 密度の高い物体ポイントクラウドでは、損失なしモードで G-PCC と比較して 50.18% の Bpp 減少を達成し、損失ありモードでは 17% 以上の BD-rate 優位を達成した。
  • OctAttention と比較して復号時間が約 640 倍短縮され、本手法では 6 秒未満で復号が可能である一方、OctAttention では約 1 時間を要した。
  • k を 16 から 64 に増加させることで性能が向上したが、OctAttention が使用する 1024 個の近隣と比較して、k=64 でも顕著に少ないため、高い効率性を示した。
  • 12-bit, 10-bit, 9-bit 精度のポイントクラウドを含む、すべてのテスト済みデータセットおよびビット深度において、G-PCC や SparsePCGC を上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。