Skip to main content
QUICK REVIEW

[論文レビュー] Superpoint Transformer for 3D Scene Instance Segmentation

Jiahao Sun, Chunmei Qing|arXiv (Cornell University)|Nov 28, 2022
Advanced Neural Network Applications被引用数 7
ひとこと要約

本稿では、点群特徴をスーパーポイントにグループ化し、トランスフォーマーを用いた学習可能クエリデコーダーを用いて、スーパーポイント間クロスアテンションにより直接インスタンスマスクを予測する、エンドツーエンドの3次元インスタンスセグメンテーション手法SPFormerを提案する。この手法は、中間集約処理や後処理を不要とし、1フレームあたり247msの高速推論を維持しながら、ScanNetv2の隠しテストセットで4.3%高いmAPを達成し、最先端の性能を実現した。

ABSTRACT

Most existing methods realize 3D instance segmentation by extending those models used for 3D object detection or 3D semantic segmentation. However, these non-straightforward methods suffer from two drawbacks: 1) Imprecise bounding boxes or unsatisfactory semantic predictions limit the performance of the overall 3D instance segmentation framework. 2) Existing method requires a time-consuming intermediate step of aggregation. To address these issues, this paper proposes a novel end-to-end 3D instance segmentation method based on Superpoint Transformer, named as SPFormer. It groups potential features from point clouds into superpoints, and directly predicts instances through query vectors without relying on the results of object detection or semantic segmentation. The key step in this framework is a novel query decoder with transformers that can capture the instance information through the superpoint cross-attention mechanism and generate the superpoint masks of the instances. Through bipartite matching based on superpoint masks, SPFormer can implement the network training without the intermediate aggregation step, which accelerates the network. Extensive experiments on ScanNetv2 and S3DIS benchmarks verify that our method is concise yet efficient. Notably, SPFormer exceeds compared state-of-the-art methods by 4.3% on ScanNetv2 hidden test set in terms of mAP and keeps fast inference speed (247ms per frame) simultaneously. Code is available at https://github.com/sunjiahao1999/SPFormer.

研究の動機と目的

  • 中間の物体検出やセマンティックセグメンテーションステップに依存する従来の3次元インスタンスセグメンテーション手法の限界を解消すること。
  • グループ化ベースの手法で一般的な時間のかかる集約ステップを排除し、エンドツーエンド学習を可能にすること。
  • セマンティックラベルからの直接的监督なしに、中間レベルの潜在的表現としてのスーパーポイントを活用することで、インスタンスセグメンテーションの精度を向上させること。
  • 学習可能なクエリベクトルとスーパーポイント特徴の間のクロスアテンションにより、インスタンスレベルの情報を捉えるクエリデコーダーを設計すること。
  • 非最大抑制や中間処理ステップを回避することで、高速推論を実現しながら高い性能を達成すること。

提案手法

  • 入力点群からポイントワイドな特徴を抽出するためにスパース3D U-Netを用いる。
  • スーパーポイントプーリング層により、これらの特徴をスーパーポイントにグループ化し、3次元シーンの潜在的中間表現として機能させる。
  • トランスフォーマーに基づくクエリデコーダーを用いたクロスアテンションにより、学習可能なクエリベクトルがスーパーポイント特徴に注目することで、インスタンスを提案する。
  • ボクシングボックスやセマンティックラベルに依存せず、スーパーポイント特徴から直接インスタンスクラス、スコア、マスク予測を生成する。
  • スーパーポイントマスクに基づくバイパートマッチングにより、中間集約や精練モジュールを必要とせず、エンドツーエンド学習を可能にする。
  • マスク予測にはDice損失とバイナリクロスエントロピー損失の組み合わせを用い、アブレーションスタディで最適であることが示された。

実験結果

リサーチクエスチョン

  • RQ1ボトムアップのスーパーポイントグループ化とトップダウンのクエリベース提案を組み合わせたハイブリッド2段階フレームワークは、3次元インスタンスセグメンテーションの性能を向上させることができるか?
  • RQ2集約ステップを中間段階に含めないことで、エンドツーエンド学習をどのように達成できるか?
  • RQ3自己アテンションとクロスアテンションを用いて、スーパーポイント特徴からインスタンスレベルの情報を捉える最適なクエリデコーダーの設計は何か?
  • RQ4ラベルなしで学習された潜在的スーパーポイント特徴を用いることで、セマンティックまたはセンターの監督に依存する手法と比較して一般化性能が向上するか?
  • RQ5提案手法は、高速推論速度を維持しながら最先端の性能を達成できるか?

主な発見

  • SPFormerは、従来の最先端手法と比較して、ScanNetv2の隠しテストセットで4.3%高いmAPを達成した。
  • モデルは1フレームあたり247msという高速な推論速度を維持しており、集約ステップを要する手法と比べ顕著に優れた性能を示した。
  • アブレーションスタディの結果、Dice損失とバイナリクロスエントロピー損失を組み合わせることで、マスク予測性能が最良となった。
  • 6層のトランスフォーマー・デコーダーと400個のクエリベクトルを用いることで最適な性能が得られ、800個のクエリに達すると性能が飽和した。
  • トランスフォーマー・デコーダーにおける位置エンコーディングの削除は性能に悪影響を及げず、3次元点群の不規則性のためと推測される。
  • クロスアテンション機構は、注目度マップと対応するマスク予測の可視化から、関心領域を効果的に強調していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。