Skip to main content
QUICK REVIEW

[論文レビュー] Sparse Single Sweep LiDAR Point Cloud Segmentation via Learning Contextual Shape Priors from Scene Completion

Yan Xu, Jiantao Gao|arXiv (Cornell University)|Dec 7, 2020
3D Shape Modeling and Analysis参考文献 43被引用数 18
ひとこと要約

本稿では、エンド・トゥ・エンド学習により、意味的シーンコンプリート(SSC)から学習された文脈的形状事前知識を活用する、スパースなシングルスイープLiDAR点群の意味的セグメンテーションのための新規フレームワーク、JS3C-Netを提案する。ポイントボクセル相互作用(PVI)モジュールを介して、意味的セグメンテーション(SS)とSSCを同時に学習することで、特徴の統合を向上させ、最先端の性能を達成し、SemanticKITTIではmIoUを4%、SemanticPOSSでは3%向上させた。

ABSTRACT

LiDAR point cloud analysis is a core task for 3D computer vision, especially for autonomous driving. However, due to the severe sparsity and noise interference in the single sweep LiDAR point cloud, the accurate semantic segmentation is non-trivial to achieve. In this paper, we propose a novel sparse LiDAR point cloud semantic segmentation framework assisted by learned contextual shape priors. In practice, an initial semantic segmentation (SS) of a single sweep point cloud can be achieved by any appealing network and then flows into the semantic scene completion (SSC) module as the input. By merging multiple frames in the LiDAR sequence as supervision, the optimized SSC module has learned the contextual shape priors from sequential LiDAR data, completing the sparse single sweep point cloud to the dense one. Thus, it inherently improves SS optimization through fully end-to-end training. Besides, a Point-Voxel Interaction (PVI) module is proposed to further enhance the knowledge fusion between SS and SSC tasks, i.e., promoting the interaction of incomplete local geometry of point cloud and complete voxel-wise global structure. Furthermore, the auxiliary SSC and PVI modules can be discarded during inference without extra burden for SS. Extensive experiments confirm that our JS3C-Net achieves superior performance on both SemanticKITTI and SemanticPOSS benchmarks, i.e., 4% and 3% improvement correspondingly.

研究の動機と目的

  • 自動運転車両で一般的なスパースでシングルスイープLiDAR点群における正確な意味的セグメンテーションの課題に対処すること。
  • 過去のフレームに依存する従来手法の限界を克服し、高い計算コストを回避すること。
  • 連続するLiDARデータを活用して、不完全でスパースな点群のセグメンテーションを向上させるための頑健な文脈的形状事前知識を学習すること。
  • 補助的なSSCおよびPVIモジュールを推論時においても削除可能であり、リアルタイム効率を保証する軽量でモジュラーなフレームワークを設計すること。
  • 相互に補い合う意味的セグメンテーションとシーンコンプリートの最適化を、相互作用的な特徴統合を伴うエンド・トゥ・エンドの共同学習によって実現すること。

提案手法

  • スパースなシングルスイープ点群に対して初期予測を生成するために、事前学習済みの意味的セグメンテーション(SS)バックボーンを用いる。
  • 連続フレームを統合したデータを密度付きの教師信号として用い、文脈的形状事前知識を学習するための意味的シーンコンプリート(SSC)モジュールを訓練する。
  • ポイント単位の局所的幾何とボクセル単位のグローバル構造との間で双方向の知識移転を可能にするため、ポイント・ボクセル相互作用(PVI)モジュールを導入する。
  • SSとSSCの最適化を自動的にバランスさせるために、不確実性マルチタスク損失(UMTL)を適用する。
  • SSバックボーンの速度に影響を与えないように、SSCおよびPVIモジュールを推論時に削除可能な段階的構造でネットワークを設計する。
  • 手動アノテーションの必要性を排除するため、大規模でアノテーションのないLiDARシーケンスを用いて、SSCのための密度付きの真値を合成する。

実験結果

リサーチクエスチョン

  • RQ1複数フレームのシーンコンプリートから学習した文脈的形状事前知識は、スパースなシングルスイープLiDAR点群の意味的セグメンテーションを改善できるか?
  • RQ2軽量でエンド・トゥ・エンドのフレームワークにおいて、意味的セグメンテーションとシーンコンプリートをどのように共同最適化し、互いに補い合えるか?
  • RQ3PVIモジュールは、局所的ポイントレベルの幾何とグローバルなボクセルレベルの構造を効果的に統合し、特徴表現を向上させることができるか?
  • RQ4形状事前知識を用いた共同学習によって、スパース領域や自転車・トラックのような小サイズの物体における性能ギャップはどの程度縮小されるか?
  • RQ5推論時に補助的なSSCおよびPVIモジュールを無効化しても、主なセグメンテーションヘッドの速度に影響を及げないか?

主な発見

  • JS3C-Netは、先行する最先端手法と比較して、SemanticKITTIベンチマークでmIoUを4%向上させた。
  • SemanticPOSSベンチマークでは、既存の手法を上回り、mIoUを3%向上させ、優れた一般化性能を示した。
  • アブレーションスタディにより、共同学習(JL)によりSSのmIoUが63.1%から66.1%に、SCのmIoUが51.1%から55.0%に向上したことが確認された。
  • 不確実性マルチタスク損失(UMTL)を組み込むことで、SSとSCのmIoUはそれぞれ0.4%および1.1%向上し、より良い損失バランスが実現された。
  • PVIモジュールは性能向上に顕著な寄与を示しており、フルモデルではSSで67.5%、SCで57.0%のmIoUを達成し、すべてのアブレーションバリアントを上回った。
  • JS3C-Netは、バックボーンモデルと同等の推論速度を維持しており、PVIモジュールによる遅延増加はわずか107msであり、リアルタイムデプロイメントに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。