Skip to main content
QUICK REVIEW

[論文レビュー] CenterMask: single shot instance segmentation with point representation

Yuqing Wang, Zhaoliang Xu|arXiv (Cornell University)|Apr 9, 2020
Advanced Neural Network Applications参考文献 32被引用数 8
ひとこと要約

CenterMaskは、アノテーションボックスを用いず、1段階で高速かつ高精度なインスタンスセグメンテーションを実現するシンプルで高速な手法を提案する。マスク予測を2つの並列ブランチに分離する:オブジェクトの中心点表現を用いた局所的形状予測(重複するインスタンスを区別可能に)、およびピクセル単位のセグメンテーションを高精度に実現するグローバルサリエンシーマップの生成。単一スケールでの推論で、事前学習なしに訓練された結果、COCOで12.3 fpsで34.5のマスクAPを達成し、他のすべての1段階手法を上回るが、はるかに遅いTensorMaskを除いては、最良の性能を示した。

ABSTRACT

In this paper, we propose a single-shot instance segmentation method, which is simple, fast and accurate. There are two main challenges for one-stage instance segmentation: object instances differentiation and pixel-wise feature alignment. Accordingly, we decompose the instance segmentation into two parallel subtasks: Local Shape prediction that separates instances even in overlapping conditions, and Global Saliency generation that segments the whole image in a pixel-to-pixel manner. The outputs of the two branches are assembled to form the final instance masks. To realize that, the local shape information is adopted from the representation of object center points. Totally trained from scratch and without any bells and whistles, the proposed CenterMask achieves 34.5 mask AP with a speed of 12.3 fps, using a single-model with single-scale training/testing on the challenging COCO dataset. The accuracy is higher than all other one-stage instance segmentation methods except the 5 times slower TensorMask, which shows the effectiveness of CenterMask. Besides, our method can be easily embedded to other one-stage object detectors such as FCOS and performs well, showing the generalization of CenterMask.

研究の動機と目的

  • アノテーションボックスを一切使用せず、シンプルで高速かつ高精度な1段階インスタンスセグメンテーション手法の開発。
  • 重複するオブジェクトが存在する状況におけるインスタンス同士の区別と、ピクセル単位の特徴のずれの課題の解決。
  • マスク予測を2つの補完的要素に分離する:インスタンスに依存する局所的形状と、インスタンスに依存しないグローバルサリエンシーマップ。これにより、精度と速度の両立を実現。
  • FCOSのような他の1段階検出器に対しても一般化可能であることを示し、広範な適用可能性を示す。

提案手法

  • キーポイント推定ヘッドを用いてオブジェクトの中心点位置を予測し、その点での特徴抽出により粗い局所的形状マスクを生成する。
  • 完全畳み込み型バックボーンがグローバルサリエンシーマップを生成し、ピクセル単位の前景・背景分類を可能にすることで、正確な境界の一致を実現する。
  • 最終的なインスタンスマスクは、粗いインスタンスに依存する局所的形状マスクと、正確でインスタンスに依存しないグローバルサリエンシーマップの要素ごとの積として形成される。
  • 局所的形状ブランチでは、中心点における形状ベクトル表現を用いることで、重複する状況でも効果的なインスタンス分離が可能になる。
  • グローバルサリエンシーマップはセマンティックセグメンテーションに似ており、高分解能かつアライメントの取れた特徴を提供し、正確なマスク境界を実現する。
  • 本手法は、事前学習重みなしでエンドツーエンドに訓練され、NMSを用いず、推論が行われる。

実験結果

リサーチクエスチョン

  • RQ11段階インスタンスセグメンテーションモデルは、アノテーションボックスや複雑な後処理なしに高い精度を達成できるか?
  • RQ2シンプルで学習可能な表現を用いて、重複する状況下でもオブジェクトインスタンスを効果的に区別できるか?
  • RQ3TensorMaskのような高コストな処理を用いずに、ピクセル単位の特徴の一致を達成できるか?
  • RQ4局所的形状とグローバルサリエンシーの組み合わせが、インスタンス分離とマスク精度の両方をどの程度向上させるか?
  • RQ5提案された構成要素は、FCOSのような他の1段階検出器にも一般化可能か?

主な発見

  • CenterMaskは、単一スケールでの学習・推論で、COCOで12.3 fpsで34.5のマスクAPを達成し、他のすべての1段階インスタンスセグメンテーション手法を上回ったが、5倍遅いTensorMaskを除いては、最良の性能を示した。
  • 局所的形状ブランチ単体でも、重複する状況下で効果的なインスタンス分離が可能で、粗いが明確なマスクが得られる。
  • グローバルサリエンシーブランチ単体では、正確なセグメンテーションが可能だが、重複状況ではアーチファクトが発生する。
  • 両ブランチの組み合わせにより、複雑な状況下でも最先端の性能が達成され、正確なインスタンス分離と高品質なマスク境界の両方が実現された。
  • FCOSに統合した場合、CenterMask-FCOSはResNeXt-101-FPN-DCNを用いてCOCO test-devで38.5 mAPを達成し、PolarMaskを上回り、より高品質なアノテーションを用いたMask R-CNNと同等の性能を示した。
  • LVISベンチマークでは、CenterMask-FCOSがResNeXt-101-FPN-DCNを用いて40.0 mAPを達成し、同じデータセットで36.0 mAPを記録したMask R-CNNを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。