Skip to main content
QUICK REVIEW

[論文レビュー] Box2Mask: Weakly Supervised 3D Semantic Instance Segmentation Using Bounding Boxes

Julian Chibane, Francis Engelmann|arXiv (Cornell University)|Jun 2, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

本論文では、3次元バウンディングボックスのアノテーションのみを用いて深層モデルを学習する弱教師あり手法であるBox2Maskを提案する。この手法は、1点ごとのラベル付けにかかるコストを回避する。ハフ投票に着想を得ており、ボックスパラメータを直接回帰し、投票を集約して密なインスタンスマスクを生成する。ScanNetでは完全教師ありモデルのmAP50スコアの97%を達成し、ARKitScenesでもボックスレベルのアノテーションのみで優れた性能を発揮する。

ABSTRACT

Current 3D segmentation methods heavily rely on large-scale point-cloud datasets, which are notoriously laborious to annotate. Few attempts have been made to circumvent the need for dense per-point annotations. In this work, we look at weakly-supervised 3D semantic instance segmentation. The key idea is to leverage 3D bounding box labels which are easier and faster to annotate. Indeed, we show that it is possible to train dense segmentation models using only bounding box labels. At the core of our method, ame{}, lies a deep model, inspired by classical Hough voting, that directly votes for bounding box parameters, and a clustering method specifically tailored to bounding box votes. This goes beyond commonly used center votes, which would not fully exploit the bounding box annotations. On ScanNet test, our weakly supervised model attains leading performance among other weakly supervised approaches (+18 mAP@50). Remarkably, it also achieves 97% of the mAP@50 score of current fully supervised models. To further illustrate the practicality of our work, we train Box2Mask on the recently released ARKitScenes dataset which is annotated with 3D bounding boxes only, and show, for the first time, compelling 3D instance segmentation masks.

研究の動機と目的

  • 3次元セマンティックインスタンスマスク分類におけるアノテーション負荷を軽減するため、1点ごとのラベル付けを、より容易にアノテート可能な3次元バウンディングボックスに置き換える。
  • 深層学習手法を設計し、バウンディングボックスアノテーションを最大限に活用して密な予測を実現する。これは単なるセンター点の監視をはるかに超える。
  • ボックスアノテーションのみで学習された弱教師ありモデルが、先行研究の弱教師あり手法を上回る性能を示すかどうかを実証する。
  • 3次元バウンディングボックスでアノテートされた大規模データセット(例:ARKitScenes)において、高品質な3次元インスタンスマスク分類を実現する。

提案手法

  • 点群特徴から3次元バウンディングボックスのパラメータ(中心、サイズ、クラス)を直接回帰する深層ハフ投票ネットワークを提案する。
  • バウンディングボックス予測から得られる投票クラスタに特化した微分可能クラスタリング機構を用い、インスタンスマスクを生成する。
  • 点から真のボックスへの新しいアソシエーション関数を導入し、重複するボックスに属する点(不確実な点)は、最近傍や最小ボックスといったヒューリスティクスを用いて監視する。
  • 点からボックスへのアソシエーションを活用して、密な予測を監視する弱教師あり損失関数を用いて、エンドツーエンドでモデルを学習する。
  • 監視信号を切り替えることで、弱教師あり設定と完全教師あり設定の両方に対応可能なフレームワークを構築する。
  • マスク生成に事後処理を用いる検出のみのベースライン手法よりも優れた性能を示す。

実験結果

リサーチクエスチョン

  • RQ13次元バウンディングボックスのアノテーションのみで、高性能な3次元セマンティックインスタンスマスク分類モデルを学習できるか?
  • RQ2ボックスアノテーションのみで学習された弱教師ありモデルの性能は、完全教師ありの最先端モデルと比べてどの程度か?
  • RQ3提案手法は、単純な点からボックスへの対応関係を越えて、完全なオブジェクトの事前知識を学習できるか?
  • RQ4ノイズや不完全なバウンディングボックスアノテーションに対して、この手法はどの程度頑健か?
  • RQ53次元バウンディングボックスのみでアノテートされた大規模データセットにおいて、本手法は説得力のあるインスタンスマスク分類結果を生成できるか?

主な発見

  • ScanNetのテストスプリットにおいて、Box2Maskは64.7 mAP50を達成し、完全教師ありSSTNetモデルの64.3 mAP50の97%に相当する。
  • 従来の弱教師あり手法を大きく上回り、mAP50で+18の向上を達成した。
  • ボックスが80%(10%欠落)の状態でも、性能は強く保たれ、mAP50が約4ポイント低下するにとどまる。
  • コーナー位置に最大20 cmの誤差があるノイズのあるボックスラベルで学習しても、性能劣化は最小限に抑えられ、頑健性を示した。
  • 3次元バウンディングボックスのみでアノテートされたARKitScenesデータセットにおいて、Box2Maskは、初めて説得力のある3次元インスタンスマスク分類マスクを生成した。実用的応用の有効性を示した。
  • 検出のみのベースライン(ScanNetで+11.8 mAP50)を大きく上回り、単なるボックスから点への対応関係を超えた、より洗練されたオブジェクトの事前知識を学習していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。