Skip to main content
QUICK REVIEW

[論文レビュー] Single Pixel Reconstruction for One-stage Instance Segmentation

Jun Yu, Jinghan Yao|arXiv (Cornell University)|Apr 16, 2019
Advanced Neural Network Applications参考文献 32被引用数 10
ひとこと要約

本稿では、1つの特徴マップの画素から専用の単一画素再構成(SPR)ブランチを用いて直接インスタンスマスクを再構成する、1段階型のインスタンスセグメンテーションフレームワークであるSPRNetを提案する。この手法は、Mask R-CNNのような2段階型手法よりも高速な推論速度を実現しながら、最先端の精度を達成した。改善されたゲートFPN(GFPN)を統合することで、SPRNetはCOCOベンチマークにおいてRetinaNetやMask R-CNNを上回り、特に小サイズ物体の検出と速度面で優れた性能を示した。

ABSTRACT

Object instance segmentation is one of the most fundamental but challenging tasks in computer vision, and it requires the pixel-level image understanding. Most existing approaches address this problem by adding a mask prediction branch to a two-stage object detector with the Region Proposal Network (RPN). Although producing good segmentation results, the efficiency of these two-stage approaches is far from satisfactory, restricting their applicability in practice. In this paper, we propose a one-stage framework, SPRNet, which performs efficient instance segmentation by introducing a single pixel reconstruction (SPR) branch to off-the-shelf one-stage detectors. The added SPR branch reconstructs the pixel-level mask from every single pixel in the convolution feature map directly. Using the same ResNet-50 backbone, SPRNet achieves comparable mask AP to Mask R-CNN at a higher inference speed, and gains all-round improvements on box AP at every scale comparing with RetinaNet.

研究の動機と目的

  • 領域提案ネットワーク(RPN)を不要とする1段階型インスタンスセグメンテーションフレームワークの開発を目的とする。
  • RoIなしで1つの特徴マップ内で複数のインスタンスを区別し、セグメンテーションする課題に対処することを目的とする。
  • 特徴レベル間の勾配干渉を低減することで、マルチスケール検出における特徴統合を改善することを目的とする。
  • 2段階型検出器よりも著しく高速な推論速度を実現しながら、競争力あるインスタンスセグメンテーション精度を達成することを目的とする。
  • 1段階型フレームワークにおいて、小サイズ物体の検出において高い性能を発揮できることを目的とする。

提案手法

  • 1つの特徴マップ画素から32×32のマスクスコアマップをデコンボリューションを用いて生成する、単一画素再構成(SPR)ブランチを導入する。
  • マスク再構成の前に、選択された画素の周囲に拡張畳み込みを適用し、十分な文脈的情報を取得する。
  • 正確な単一画素ベースのマスク予測を可能にするために、強化された特徴表現を備えた変更済みバックボーンを採用する。
  • 特徴レベル間の勾配漏れを抑制するために、特徴統合の前にゲーティング機構を導入するゲートFPN(GFPN)を提案する。
  • 学習可能なゲートを用いた要素ごとの加算により、異なるFPNレベルからの特徴を効果的に統合し、特徴品質と検出のロバスト性を向上させる。
  • SPRブランチを分類および回帰ヘッドと並列に動作させるエンコーダデコーダアーキテクチャを採用する。

実験結果

リサーチクエスチョン

  • RQ12段階型モデル(例:Mask R-CNN)と同等の性能を達成しつつ、著しく高速な1段階型インスタンスセグメンテーションモデルは実現可能か?
  • RQ2領域提案に依存せずに、特徴マップの1画素からマスク予測を効果的に開始できるか?
  • RQ3特徴レベル間の勾配フローを制御するゲーティング機構により、特に小サイズおよび大サイズ物体の検出精度が向上するか?
  • RQ4提案されたSPRNetフレームワークは、すべてのオブジェクトスケールにおいて、RetinaNetなどの既存の1段階型検出器を速度と精度の両面で上回るか?
  • RQ5SPRNetフレームワークは、ResNet-50バックボーンのみを用いて、COCOインスタンスセグメンテーションベンチマークで最先端の性能を達成できるか?

主な発見

  • SPRNetは、ResNet-50を用いてCOCO検証セットでマスクAP 36.6を達成し、RoIAlignを用いたResNet-101を搭載したMask R-CNNと同等の性能を示したが、推論速度はより高速であった。
  • ResNet-50とGFPNを用いることで、SPRNetは小サイズ物体で20.2%のAP_Sを達成し、ResNet-101を搭載した最良の2段階型手法を上回った。
  • GFPNを搭載したRetinaNetは、AP_Sを2.4ポイント(32.0から34.4に)向上させ、小サイズ物体検出において顕著な向上を示した。
  • ResNet-101とGFPNを搭載したSPRNetは、AP_S 29.7%、AR_L 68.0%を達成し、ResNet-101-FPNを搭載したMask R-CNNを両方の指標で上回った。
  • GFPNモジュールは特徴レベル間の勾配干渉を低減させ、特に大サイズ物体に対して検出性能の向上をもたらした。
  • SPRNetフレームワークは1段階型インスタンスセグメンテーションにおいて最先端の性能を達成し、高精度と高速性が1段階設計で両立可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。