Skip to main content
QUICK REVIEW

[論文レビュー] PolarMask++: Enhanced Polar Representation for Single-Shot Instance Segmentation and Beyond

Enze Xie, Wenhai Wang|arXiv (Cornell University)|May 5, 2021
Advanced Neural Network Applications参考文献 67被引用数 9
ひとこと要約

PolarMask++ は、中心点と半径距離を用いてマスクを極座標で表現する、アンカーフリーでワンショットのインスタンスセグメンテーションフレームワークを提案する。このアプローチにより、インスタンスセグメンテーションと回転物体検出が統合される。ソフト極座標センターネスと極座標IoU損失を導入することで、最小限の計算コストとリアルタイム推論性能を維持しながら、COCO、テキスト検出、細胞セグメンテーションの各ベンチマークで最先端の性能を達成した。

ABSTRACT

Reducing the complexity of the pipeline of instance segmentation is crucial for real-world applications. This work addresses this issue by introducing an anchor-box free and single-shot instance segmentation framework, termed PolarMask, which reformulates the instance segmentation problem as predicting the contours of objects in the polar coordinate, with several appealing benefits. (1) The polar representation unifies instance segmentation (masks) and object detection (bounding boxes) into a single framework, reducing the design and computational complexity. (2) Two modules are carefully designed (i.e. soft polar centerness and polar IoU loss) to sample high-quality center examples and optimize polar contour regression, making the performance of PolarMask does not depend on the bounding box prediction results and thus becomes more efficient in training. (3) PolarMask is fully convolutional and can be easily embedded into most off-the-shelf detection methods. To further improve the accuracy of the framework, a Refined Feature Pyramid is introduced to further improve the feature representation at different scales, termed PolarMask++. Extensive experiments demonstrate the effectiveness of both PolarMask and PolarMask++, which achieve competitive results on instance segmentation in the challenging COCO dataset with single-model and single-scale training and testing, as well as new state-of-the-art results on rotate text detection and cell segmentation. We hope the proposed polar representation can provide a new perspective for designing algorithms to solve single-shot instance segmentation. The codes and models are available at: github.com/xieenze/PolarMask.

研究の動機と目的

  • アンカーボックスの必要性を排除することで、インスタンスセグメンテーションパイプラインを簡素化すること。
  • 極座標表現を用いて、インスタンスセグメンテーションと回転物体検出を1つのエンドツーエンドフレームワークに統合すること。
  • 軽量な後処理精錬モジュールを用いて、不規則な形状のオブジェクトのマスク精度を向上させること。
  • 計算コストを最小限に抑えながら、高い精度を維持したままリアルタイム推論を可能にすること。

提案手法

  • オブジェクトマスクを、複数の角度間隔におけるレイの長さで定義される中心点と極座標上の輪郭として表現する。
  • バウンディングボックス予測に依存せずに、高品質な中心点をサンプリングするためのソフト極座標センターネスを導入する。
  • 輪郭回帰を直接最適化することで一般化性能を向上させ、バウンディングボックスヘッドへの依存を低減するための極座標IoU損失を提案する。
  • 異なるオブジェクトサイズに対応するためのマルチスケール特徴表現を強化する、洗練された特徴ピラミッドネットワーク(RFPN)を採用する。
  • 粗い極座標マスクを精錬するための軽量な完全畳み込みネットワーク(FCN)を適用し、特に不規則な形状のオブジェクトで効果を発揮する。
  • 既存のワンショット検出器に容易に統合可能な完全畳み込みアーキテクチャを採用する。

実験結果

リサーチクエスチョン

  • RQ1バウンディングボックスベースのアプローチと比較して、極座標表現がインスタンスセグメンテーションと回転物体検出をより効果的に統合できるか?
  • RQ2従来のデカルト座標ベースのマスク予測と比較して、極座標表現は混雑した状況や回転オブジェクトの状況でどのように性能を向上させるか?
  • RQ3ソフト極座標センターネスと極座標IoU損失は、バウンディングボックス予測への依存度をどれほど低減させ、学習効率を向上させられるか?
  • RQ4軽量なFCNによるマスク精錬は、スピードを犠牲にせずに不規則な形状のオブジェクトのセグメンテーション精度を顕著に向上させるか?
  • RQ5提案フレームワークは、COCOおよびテキスト・セルセグメンテーションなどの専用ベンチマークにおいて、単一モデル・単一スケール推論で最先端の性能を達成できるか?

主な発見

  • PolarMask++ は、単一モデル・単一スケール推論でCOCOインスタンスセグメンテーションで34.1 mAPを達成し、ベースモデル比で3.9ポイントの向上を示した。
  • マスク精錬用FCNの導入により、mAPは30.2から34.1に上昇し、特に人間(37.8 → 43.2 AP)や動物などの不規則な形状のオブジェクトで顕著な向上が見られた。
  • ボール、カップ、時計などの規則的な形状のオブジェクトでは、マスク精錬による性能低下は無視できるかわずかに低下するにとどまり、対称的な形状に対して極座標表現の強力さが裏付けられた。
  • 精錬モジュールは1オブジェクトあたり1.5msの追加推論時間を要するが、リアルタイム応用において実用的である。
  • ResNeXt-101をバックボーンとして使用すると、ResNet-50に比べてmAPが2.3%向上し、より深く強力なバックボーンの利点を示した。
  • 1台のV100 GPUで480×480入力解像度において、PolarMask++ は47.9 FPSを達成し、リアルタイムデプロイの強力な可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。