Skip to main content
QUICK REVIEW

[論文レビュー] Top-Down Beats Bottom-Up in 3D Instance Segmentation

Maksim Kolodiazhnyi, Анна Воронцова|arXiv (Cornell University)|Feb 6, 2023
Advanced Neural Network Applications被引用数 5
ひとこと要約

TD3D は、トップダウンパラダイムを採用する、完全に畳み込み的でクラスタリングフリーかつエンドツーエンドの3次元インスタンスセグメンテーション手法であり、精度と速度の両面で最新のボトムアップ手法を上回る。ScanNet v2 で 47.3 mAP を達成するとともに、最も正確なボトムアップ手法よりも 1.9× 速い。

ABSTRACT

Most 3D instance segmentation methods exploit a bottom-up strategy, typically including resource-exhaustive post-processing. For point grouping, bottom-up methods rely on prior assumptions about the objects in the form of hyperparameters, which are domain-specific and need to be carefully tuned. On the contrary, we address 3D instance segmentation with a TD3D: the pioneering cluster-free, fully-convolutional and entirely data-driven approach trained in an end-to-end manner. This is the first top-down method outperforming bottom-up approaches in 3D domain. With its straightforward pipeline, it demonstrates outstanding accuracy and generalization ability on the standard indoor benchmarks: ScanNet v2, its extension ScanNet200, and S3DIS, as well as on the aerial STPLS3D dataset. Besides, our method is much faster on inference than the current state-of-the-art grouping-based approaches: our flagship modification is 1.9x faster than the most accurate bottom-up method, while being more accurate, and our faster modification shows state-of-the-art accuracy running at 2.6x speed. Code is available at https://github.com/SamsungLabs/td3d .

研究の動機と目的

  • ボトムアップ 3D インスタンスセグメンテーション手法の優位性に挑戦し、リソース集約的な後処理やハイパーパramータチューニングに依存するのを回避すること。
  • 2D で成功を収めたトップダウンアプローチが、ポイントグループ化を伴わずに 3D ポイントクラウドに効果的に適応可能であることを示すこと。
  • 多様な 3D ベンチマークにわたって良好に一般化する、完全にスパースで畳み込み的かつエンドツーエンドで学習可能な手法を開発すること。
  • 手動のクラスタリングヒューリスティクスを排除し、精度と推論速度の両面で最先端の性能を達成すること。

提案手法

  • TD3D は 3D オブジェクト検出を用いて、初期のインスタンスプロポーザルを 3D バウンディングボックスとして生成し、ポイントグループ化の代わりにトップダウン型プロポーザル生成機構を採用する。
  • 各プロポーザル内における前景ポイントを特定するため、ポイントワイドなバイナリセグメンテーションに 3D スパース U-Net を使用する。
  • プロポーザルの精錬には、FCAF3D および IoU アサインャーを用いた 3D U-Net に類似したネットワークを採用し、プロポーザルと真値をマッチングする。
  • この手法は完全にエンドツーエンドで微分可能であり、オブジェクトのスケールや形状に関する事前の仮定を排除することで、ドメイン固有のハイパーパramータに依存する度合いを低減する。
  • RoI エクtractor により、200 ボクセル未満のプロポーザルが破棄され、性能の低下を伴わずに計算効率が確保される。
  • モデルは、ポイント分類のためのクロスエントロピー損失と、微分可能なマスク精錬ヘッドの組み合わせを用いて訓練される。

実験結果

リサーチクエスチョン

  • RQ1クラスタリングや後処理に依存せずに、トップダウン型 3D インスタンスセグメンテーション手法が、確立されたボトムアップ手法を上回ることができるか?
  • RQ2完全にデータ駆動的でエンドツーエンドで学習可能なトップダウン手法は、屋内および航空画像を含む多様な 3D ベンチマークにどの程度一般化可能か?
  • RQ3トップダウン型 3D インスタンスセグメンテーションフレームワークにおいて、初期プロポーザルの数が精度と推論速度のトレードオフに与える影響はいかほどか?
  • RQ4トップダウン型 3D インスタンスセグメンテーションパイプラインにおけるプロポーザル精錬のためのしきい値設定とアサインャー戦略の最適な構成は何か?

主な発見

  • TD3D は ScanNet v2 のバリデーションセットで 47.3 mAP を達成し、精度において最新のボトムアップ手法と同等またはそれを上回っている。
  • 主力の TD3D モデルは、最も正確なボトムアップ手法(PointGroup)よりも 1.9× 速く、速度と精度の両面で優れたトレードオフを実現している。
  • より高速なバージョンの TD3D は、既存の手法よりも 2.6× 速く、最先端の精度を達成している。
  • 最適な初期プロポーザル数は約 60 個であり、精度と推論時間のバランスを最適に保っている。
  • 最も高い性能は、ポイントバイナリセグメンテーションのしきい値が 0.2 で、IoU アサインャーのしきい値が 0.0 の場合に達成されており、フィルタリングが不要であることを示している。
  • RoI エクtractor のしきい値は 1 から 200 ボクセルの間で設定可能であり、性能に影響を及ぼさないため、このハイパーパラメータに対して頑健であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。