Skip to main content
QUICK REVIEW

[論文レビュー] Deep Projective 3D Semantic Segmentation

Felix Järemo Lawin, Martin Danelljan|arXiv (Cornell University)|May 9, 2017
3D Shape Modeling and Analysis参考文献 23被引用数 17
ひとこと要約

この論文は、3次元点群を合成2次元画像に投影することで、強力な2次元畳み込みニューラルネットワーク(CNN)を活用し、その後スコアを再投影して3次元点群に戻す、深層投影型3次元セマンティックセグメンテーションフレームワークを提案する。マルチモーダル入力(カラー、深度、法線)をマルチストリームネットワークで統合することで、Semantic3Dデータセットで7.9%の相対的改善を達成し、新たな最先端性能を実現した。

ABSTRACT

Semantic segmentation of 3D point clouds is a challenging problem with numerous real-world applications. While deep learning has revolutionized the field of image semantic segmentation, its impact on point cloud data has been limited so far. Recent attempts, based on 3D deep learning approaches (3D-CNNs), have achieved below-expected results. Such methods require voxelizations of the underlying point cloud data, leading to decreased spatial resolution and increased memory consumption. Additionally, 3D-CNNs greatly suffer from the limited availability of annotated datasets. In this paper, we propose an alternative framework that avoids the limitations of 3D-CNNs. Instead of directly solving the problem in 3D, we first project the point cloud onto a set of synthetic 2D-images. These images are then used as input to a 2D-CNN, designed for semantic segmentation. Finally, the obtained prediction scores are re-projected to the point cloud to obtain the segmentation results. We further investigate the impact of multiple modalities, such as color, depth and surface normals, in a multi-stream network architecture. Experiments are performed on the recent Semantic3D dataset. Our approach sets a new state-of-the-art by achieving a relative gain of 7.9 %, compared to the previous best approach.

研究の動機と目的

  • ボクセル化による高メモリ消費と低空間解像度という3次元CNNの3次元セマンティックセグメンテーションにおける限界を克服すること。
  • 2次元画像のセマンティックセグメンテーションの成功を活用し、3次元点群を合成2次元ビューに投影して2次元CNNに入力すること。
  • カラー、深度、表面法線といった異なる入力モダリティがセグメンテーション性能に与える寄与度を調査すること。
  • 3次元アノテーションデータが限られる現状を踏まえ、事前学習済み2次元モデルと大規模画像データセットを活用して、3次元アノテーションデータセットへの依存度を低減すること。
  • プロジェクティブでマルチストリームな深層学習アプローチを用いて、Semantic3Dベンチマークで最先端性能を達成すること。

提案手法

  • 簡易なヒューリスティックを用いて、3次元点群を複数の合成2次元画像平面に投影する。
  • 各投影画像を2次元畳み込みニューラルネットワーク(CNN)で処理し、ピixe単位のセマンティックセグメンテーションを実行する。
  • 各ビューからの予測スコアを3次元点群に再投影し、各点ごとの信頼度スコアを蓄積する。
  • カラー、深度(ジェットマップ変換済み)、表面法線入力の別々のストリームから得られる特徴を統合するマルチストリームネットワークアーキテクチャを採用し、セグメンテーション精度を向上させる。
  • 複数のビューからのスコアを投票または平均化して、各3次元点に最終的なセマンティックラベルを割り当てる。
  • ネットワークは交差エントロピー損失を用いて学習され、ベース学習率は0.0001、10エポックごとに半分に減衰させ、モーメンタムは0.99とする。

実験結果

リサーチクエスチョン

  • RQ13次元点群を2次元画像に投影することで、既存の2次元CNNを用いて高精度なセマンティックセグメンテーションが可能になるか?
  • RQ2マルチストリーム設定において、カラー、深度、表面法線といった異なる入力モダリティがセグメンテーション精度にどのように寄与するか?
  • RQ3提案手法のプロジェクティブ2次元CNNアプローチは、精度と効率の両面で3次元CNNベースの手法を上回るか?
  • RQ4カラー情報のない点群に対しても本手法は汎用性を示せるか。性能はどのように低下するか?
  • RQ5事前学習済み2次元モデルを用いることで、大規模な3次元アノテーションデータセットの必要性はどの程度低減できるか?

主な発見

  • 提案手法は、Semantic3Dのリダクション済みテストセットで58.5%の平均交差率(mIoU)を達成し、新たな最先端性能を樹立した。
  • RGB+D+Nのマルチストリーム構成は、以前の最高性能手法(TLMC-MSR、mIoU 54.2%)に対して7.9%の相対的改善を達成した。
  • RGBオンリーモデルとノーマルオンリーモデルは、それぞれmIoU 51.5%および51.1%を達成し、3次元CNNベースのVoxNetを著しく上回った。
  • D+N(深度と法線)構成は54.3%のmIoUを達成し、カラー入力がなくても高い性能を示した。
  • RGB+D+Nの3モダリティ統合は最高の性能を示し、ストリーム間で補完的である情報が得られることを示した。
  • 定性的な結果から、建物や植生といった複雑な構造物の正確なセグメンテーションが可能であり、アーチファクトは最小限に抑えられていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。