Skip to main content
QUICK REVIEW

[論文レビュー] Sparse Instance Activation for Real-Time Instance Segmentation

Tianheng Cheng, Xinggang Wang|arXiv (Cornell University)|Mar 24, 2022
Advanced Image and Video Retrieval Techniques被引用数 10
ひとこと要約

この論文では、バウンディングボックスや密度的なセンターに依存せず、判別的なオブジェクト領域を強調するためのスパARSEインスタンスアクティビションマップ(IAMs)を用いる、リアルタイムインスタンスセグメンテーションフレームワークであるSparseInstを提案する。エンド・ツー・エンドの学習のために二部マッチングを活用し、非最大抑制(NMS)を回避することで、COCOで37.9のマスクAPを達成しながら40 FPSの推論速度を実現し、従来の手法よりも速度と精度の両面で優れている。

ABSTRACT

In this paper, we propose a conceptually novel, efficient, and fully convolutional framework for real-time instance segmentation. Previously, most instance segmentation methods heavily rely on object detection and perform mask prediction based on bounding boxes or dense centers. In contrast, we propose a sparse set of instance activation maps, as a new object representation, to highlight informative regions for each foreground object. Then instance-level features are obtained by aggregating features according to the highlighted regions for recognition and segmentation. Moreover, based on bipartite matching, the instance activation maps can predict objects in a one-to-one style, thus avoiding non-maximum suppression (NMS) in post-processing. Owing to the simple yet effective designs with instance activation maps, SparseInst has extremely fast inference speed and achieves 40 FPS and 37.9 AP on the COCO benchmark, which significantly outperforms the counterparts in terms of speed and accuracy. Code and models are available at https://github.com/hustvl/SparseInst.

研究の動機と目的

  • 密度的な予測と後処理に依存する既存のリアルタイムインスタンスセグメンテーション手法の非効率さと高レイテンシを解消すること。
  • 非最大抑制(NMS)を回避し、計算オーバーヘッドを低減する完全畳み込み型でエンド・ツー・エンドのフレームワークを開発すること。
  • 領域やセンターに基づく表現ではなく、スパARSEなアクティビションマップを用いて情報量の多いインスタンスに特化した領域を強調することで、特徴の集約を向上させること。
  • 自動運転やロボット工学などのリアルタイム応用において、優れたスピード・アキュラシーのトレードオフを達成すること。

提案手法

  • 特徴空間内で判別的なインスタンスに特化した領域を強調する新しいオブジェクト表現として、インスタンスアクティビションマップ(IAMs)を提案する。
  • 特徴マップからIAMsを生成するために$3\times3$畳み込み層を用い、局所的な文脈認識と空間的局所化を可能にする。
  • トレーニング中に真のラベルインスタンスを予測に割り当てるためにハンガリアンアルゴリズムを用いた二部マッチングを適用し、NMSに依存しないエンド・ツー・エンド学習を実現する。
  • 計算コストとレイテンシを低減するため、単一レベルの特徴予測ヘッドを採用する。
  • RoI-Alignや領域ベースの操作を回避し、IAMsから直接インスタンス特徴とセグメンテーションマスクを生成する完全畳み込み型デコーダーを設計する。
  • ソート処理やNMSを排除した軽量な後処理パイプラインを導入し、推論時間を顕著に短縮する。

実験結果

リサーチクエスチョン

  • RQ1スパARSEでインスタンスに特化したアクティビションマップ表現は、密度的なセンターまたは領域ベースの表現を上回るのか?
  • RQ2アンカーまたはセンターのような手作業で設計された空間的プライオリティに依存せず、IAMsを効果的にエンド・ツー・エンドで学習できるか?
  • RQ3二部マッチングを用いてIAMsを学習させることで、重複する予測を抑制し、NMSの必要性を排除できるか?
  • RQ4$3\times3$畳み込みを用いたIAM生成は、$1\times1$畳み込みやクエリベースのアテンションに比べて、特徴品質をどの程度向上させるか?
  • RQ5IAMsを用いた単一レベルの完全畳み込み型フレームワークは、多段階で検出器に基づく手法と比較して、スピード・アキュラシーのトレードオフはどの程度か?

主な発見

  • SparseInstは、1枚のNVIDIA 2080Ti GPUで40.0 FPSの推論速度を達成し、COCOテストデブセットで37.9のマスクAPを記録した。これは、従来のリアルタイム手法と比較して、スピードとアキュラシーの両面で顕著に優れている。
  • 入力解像度を$448\times448$にした場合、58.5 FPSに達するが、競争力のある精度を維持しており、小さな入力でも高い効率性を示している。
  • ラベル割り当てに二部マッチングを用いることで、NMSなしのエンド・ツー・エンド学習が可能になり、後処理時間が総推論時間の約10%短縮された。
  • 可視化結果から、IAMsはスケールの変化、オクルージョン、ポーズの違いに関わらず、一貫して判別的なオブジェクト部分を強調しており、頑健なインスタンス局所化を可能としている。
  • IAMsを4ヘッドのクロスアテンションや100のクエリに置き換えると、APが0.2~0.9低下し、$3\times3$畳み込みに基づくIAM設計の優位性が確認された。
  • 混雑したシーンにも良好に一般化し、高密度なインスタンス状況下でも細かい境界を持つ正確なセグメンテーションマスクを生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。