Skip to main content
QUICK REVIEW

[論文レビュー] Mask Encoding for Single Shot Instance Segmentation

Rufeng Zhang, Zhi Tian|arXiv (Cornell University)|Mar 26, 2020
Advanced Neural Network Applications参考文献 35被引用数 4
ひとこと要約

本論文は、主にPCAを含む辞書学習(例:PCA)を用いて2次元インスタンスマスクをコンパクトで固定次元のベクトルに符号化する、新しいワンショットインスタンスセグメンテーションフレームワークMEInstを提案する。これにより、FCOSのようなワンステージ検出器内での効率的な回帰ベースのマスク予測が可能になる。1つのResNeXt-101-FPNモデルとシングルスケールテストを用いた場合、COCO上で36.9%のマスクAPを達成し、先行するワンステージ手法を上回り、小サイズオブジェクトにおいても優れた性能を示し、リアルタイム推論能力を維持している。

ABSTRACT

To date, instance segmentation is dominated by twostage methods, as pioneered by Mask R-CNN. In contrast, one-stage alternatives cannot compete with Mask R-CNN in mask AP, mainly due to the difficulty of compactly representing masks, making the design of one-stage methods very challenging. In this work, we propose a simple singleshot instance segmentation framework, termed mask encoding based instance segmentation (MEInst). Instead of predicting the two-dimensional mask directly, MEInst distills it into a compact and fixed-dimensional representation vector, which allows the instance segmentation task to be incorporated into one-stage bounding-box detectors and results in a simple yet efficient instance segmentation framework. The proposed one-stage MEInst achieves 36.4% in mask AP with single-model (ResNeXt-101-FPN backbone) and single-scale testing on the MS-COCO benchmark. We show that the much simpler and flexible one-stage instance segmentation method, can also achieve competitive performance. This framework can be easily adapted for other instance-level recognition tasks. Code is available at: https://git.io/AdelaiDet

研究の動機と目的

  • ワンステージインスタンスセグメンテーションにおけるマスクのコンパクトな表現を解決すること。これは、Mask R-CNNのような二段階手法と比較して性能が劣っていた要因である。
  • 2次元マスクを固定次元の表現ベクトルに蒸留することで、効率的かつ正確なマスク予測を可能にし、設計および計算の複雑性を低減すること。
  • マスク係数回帰を用いた単純なワンステージフレームワークが、複雑なアーキテクチャやマルチステージパイプラインに依存せずに競争力のある精度を達成できることを示すこと。
  • 辞書学習(例:PCA)によるマスク符号化が、頑健でノイズに強い、かつ容易に再構成可能なマスク表現を可能にすること。
  • アンカーベースおよびアンカーレスの両方のパラダイムに対応可能な汎用的なフレームワークを確立すること。

提案手法

  • 本手法は、PCAやスパースコーディング、オートエンコーダーなどの辞書学習技術を用いて、各2次元インスタンスマスクをコンパクトで固定次元のベクトルに符号化する。
  • マスク表現は、自然なマスクの低固有次元性を活用して、データセット内のインスタンスマスクから学習される。これにより、冗長性が低減される。
  • ワンステージ検出器(例:FCOS)に並列のマスクブランチを追加し、固定次元のマスク係数を回帰することで、エンドツーエンドの学習が可能になる。
  • 復元されたマスクは、学習済みの辞書を用いて係数ベクトルをデコードすることで得られ、高精度なマスク再構成が可能になる。
  • 本フレームワークはアンカーベースおよびアンカーレスの両検出器と互換性があり、アーキテクチャの変更を最小限に抑えることができる。
  • 本手法は、特に離散的または複雑な形状で顕著な「へこみ腐食(hollow decay)」アーチファクトを引き起こす輪郭ベース表現を回避する。

実験結果

リサーチクエスチョン

  • RQ1インスタンスマスクのコンパクトで固定次元のベクトル表現は、ワンステージ検出器において競争力のあるセグメンテーション精度を達成できるか?
  • RQ2辞書学習(例:PCA)によるマスク符号化は、パrametricな輪郭ベース手法と比較して、より優れた再構成忠実度と耐性を実現できるか?
  • RQ3マスク係数回帰を用いた単純なワンステージインスタンスセグメンテーションフレームワークは、精度と推論速度の両面で既存のワンステージ手法を上回れるか?
  • RQ4本手法の性能は、特に小サイズおよび大サイズのオブジェクトにおいて、Mask R-CNNのような二段階手法と比較してどの程度優れているか?
  • RQ5マスク符号化フレームワークは、さまざまなワンステージ検出器アーキテクチャにどの程度一般化可能か?

主な発見

  • MEInstは、1つのResNeXt-101-FPNモデルとシングルスケールテストを用いた場合、COCOで36.9%のマスクAPを達成し、多数の先行ワンステージ手法を上回っている。
  • ESE-Seg(最先端の輪郭ベース手法)と比較して、AP50で11.8%、AP75で16.5%の向上を示し、優れた精度と詳細の保持能力を実証している。
  • PolarMaskと同等の計算複雑性でありながら、より低い再構成誤差とより効果的なマスク表現のおかげで、精度で上回っている。
  • 小サイズオブジェクト(面積 < 32²)では、MEInstは38.0%のマスクAPを達成したのに対し、Mask R-CNNは35.3%であった。これは、小インスタンスの処理において顕著な優位性を示している。
  • 大サイズオブジェクトでは、MEInstは46.7%のマスクAPを達成したが、Mask R-CNNは53.5%であった。これは、高詳細マスクに対してコンパクトなベクトル表現の表現能力が限界に達しているための性能差である。
  • データオーグメンテーション(マルチスケール)を適用した場合、MEInstはCOCO test-devで38.2%のマスクAPに達し、強力なスケーラビリティとさらなる向上の可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。