Skip to main content
QUICK REVIEW

[論文レビュー] Mask-Attention-Free Transformer for 3D Instance Segmentation

Xin Lai, Yuhui Yuan|arXiv (Cornell University)|Sep 4, 2023
Advanced Neural Network Applications被引用数 4
ひとこと要約

本論文は、初期マスクの低再現率による遅い収束を克服するため、マスクアテンションを廃止し、補助的なセンター回帰タスクに置き換える3DインスタンスセグメンテーションのためのマスクアテンションフリーなTransformerを提案する。密度の高い位置クエリ、相対的位置エンコーディング、反復的精錬を用いることで、収束が4倍速くなり、ScanNetv2で新たなSOTAを達成し、少ないトレーニングエポック数で先行手法を上回る性能を発揮する。

ABSTRACT

Recently, transformer-based methods have dominated 3D instance segmentation, where mask attention is commonly involved. Specifically, object queries are guided by the initial instance masks in the first cross-attention, and then iteratively refine themselves in a similar manner. However, we observe that the mask-attention pipeline usually leads to slow convergence due to low-recall initial instance masks. Therefore, we abandon the mask attention design and resort to an auxiliary center regression task instead. Through center regression, we effectively overcome the low-recall issue and perform cross-attention by imposing positional prior. To reach this goal, we develop a series of position-aware designs. First, we learn a spatial distribution of 3D locations as the initial position queries. They spread over the 3D space densely, and thus can easily capture the objects in a scene with a high recall. Moreover, we present relative position encoding for the cross-attention and iterative refinement for more accurate position queries. Experiments show that our approach converges 4x faster than existing work, sets a new state of the art on ScanNetv2 3D instance segmentation benchmark, and also demonstrates superior performance across various datasets. Code and models are available at https://github.com/dvlab-research/Mask-Attention-Free-Transformer.

研究の動機と目的

  • 従来のTransformerに基づく3Dインスタンスセグメンテーション手法における収束が遅い問題に対処すること。
  • マスクアテンションに起因する初期インスタンスマスクの低再現率が、トレーニングの不安定さの根本的原因であると特定すること。
  • マスクアテンションをセンター回帰に基づくガイダンス機構に置き換えることで、トレーニングの効率性と正確性を向上させること。
  • 密度の高い位置クエリや相対的位置エンコーディングといった位置に敏感なコンponentsを設計し、新しいトレーニングパラダイムを支援すること。
  • 著しく短いトレーニング時間でSOTA性能を達成すること。

提案手法

  • 学習可能な、3D空間を網羅する密度の高い位置クエリを導入し、トレーニングの初期段階からオブジェクトインスタンスの高再現率を確保する。
  • マスクアテンションを、予測されたセンター座標を用いてクロスアテンションをガイドするセンター回帰タスクに置き換えることで、低品質な初期マスクに依存しなくなる。
  • クロスアテンション層で相対的位置エンコーディング(RPE)を採用し、クエリとポイント間の空間的関係をモデル化することで、ハードマスキングを排除する。
  • デコーダーレイヤー全体で位置クエリを反復的に精錬することで、段階的に局所化の正確性を向上させる。
  • トレーニング中にセンターに基づくマッチングとセンター損失を導入し、予測値を真値のインスタンスセンターに一致させる。
  • コンテンツクエリ(特徴量集約用)と位置クエリ(空間的ガイダンス用)の二重ストリームクエリ機構を採用し、両者を反復的に精錬する。

実験結果

リサーチクエスチョン

  • RQ1なぜ従来のTransformerベースの3Dインスタンスセグメンテーション手法は収束が遅いのか?
  • RQ2マスクアテンション機構における初期マスクの低再現率が、トレーニングの不安定さの主な要因であると考えられるか?
  • RQ3マスクアテンションをセンター回帰タスクに置き換えることで、収束速度とセグメンテーション正確性が向上するか?
  • RQ4マスクアテンションフリーなTransformerにおいて、位置の事前知識を効果的に活用する方法は何か?
  • RQ5密度の高い位置クエリ、相対的位置エンコーディング、反復的精錬といった設計選択肢の中で、性能向上に最も寄与するのはどれか?

主な発見

  • 提案手法は、ScanNetv2 3Dインスタンスセグメンテーションベンチマークで63.9%のmAP@50と73.5%のmAP@25を達成し、新たなSOTAを樹立した。
  • ベースラインと比較して4倍速い収束を達成し、512エポックのベースラインを128エポックの訓練で上回った。
  • アブレーションスタディの結果、センターマッチングとセンター損失の両者が1.6%以上のmAP向上に寄与しており、両方を同時に削除するとmAPが2.0%低下した。
  • 相対的位置エンコーディングが絶対的位置エンコーディングやコンテンツに依存する位置エンコーディングを上回り、空間的関係をモデル化することの重要性を裏付けた。
  • 位置クエリの反復的精錬によりmAPが0.9%向上し、空間的局所化の精錬における価値を示した。
  • 本手法は一般化性能に優れ、ScanNetv2、ScanNet200、S3DISを含む複数のデータセットで優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。