Skip to main content
QUICK REVIEW

[論文レビュー] Object Detection Free Instance Segmentation With Labeling Transformations

Long Jin, Zeyu Chen|arXiv (Cornell University)|Nov 28, 2016
Advanced Neural Network Applications参考文献 29被引用数 15
ひとこと要約

本論文は、オブジェクト検出を回避する検出不要のインスタンスセグメンテーションフレームワークを提案する。この手法は、ピクセルベースのアフィニティマッピング、スーパーピクセルベースのアフィニティ学習、境界ベースのコンポonentセグメンテーションの3つの方法を用いてラベル変換を活用する。完全畳み込みネットワーク(FCN)を用いることで、オブジェクト中心(PASCAL VOC 2012)およびテクスチャ中心(Gland)の両データセットで最先端の性能を達成し、オブジェクト提案やバウンディングボックスに依存せず、一般化性、透明性、効率性に優れていることを示している。

ABSTRACT

Instance segmentation has attracted recent attention in computer vision and existing methods in this domain mostly have an object detection stage. In this paper, we study the intrinsic challenge of the instance segmentation problem, the presence of a quotient space (swapping the labels of different instances leads to the same result), and propose new methods that are object proposal- and object detection- free. We propose three alternative methods, namely pixel-based affinity mapping, superpixel-based affinity learning, and boundary-based component segmentation, all focusing on performing labeling transformations to cope with the quotient space problem. By adopting fully convolutional neural networks (FCN) like models, our framework attains competitive results on both the PASCAL dataset (object-centric) and the Gland dataset (texture-centric), which the existing methods are not able to do. Our work also has the advantages in its transparency, simplicity, and being all segmentation based.

研究の動機と目的

  • オブジェクト検出に依存せずに、商空間(すなわち、入れ替え可能なインスタンスID)に起因するラベルの曖昧さというインスタンスセグメンテーションの根本的課題に対処すること。
  • オブジェクトプロポーザルや検出ステージの複雑さと制限を回避するセグメンテーション専用のフレームワークを開発すること。
  • 非剛性で変形しやすいオブジェクトを含む、オブジェクト中心およびテクスチャ中心の両データセットに対しても効果的なインスタンスセグメンテーションを可能にすること。
  • 検出ヘッドのコンponentを排除することで、モデルの透明性、単純さ、計算効率を向上させること。

提案手法

  • 検出不要の3つの手法(ピクセルベースのアフィニティマッピング、スーパーピクセルベースのアフィニティ学習、境界ベースのコンポonentセグメンテーション)を提案し、商空間問題に対処する。
  • 完全畳み込みニューラルネットワーク(FCN)を用いて、ピクセルまたはスーパーピクセルごとのアフィニティを予測し、密度予測のエンドツーエンド学習を可能にする。
  • ラベル変換を適用して、曖昧なインスタンスラベリング問題をアフィニティ学習を介して学習可能な分類/回帰タスクに変換する。
  • セマンティックセグメンテーションからの連結成分をベースラインとし、学習されたアフィニティを用いてそれらを改善してインスタンスを分離する。
  • インスタンスIDを交換可能にする変換戦略を導入し、モデルが領域間の相対的関係を学習するようにする。
  • 同じインスタンスに属するピクセルには高いアフィニティ、異なるインスタンスに属するピクセルには低いアフィニティを促進する損失関数を用いてモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1オブジェクト検出またはプロポーザルステージを排除しながらも、競争力のある性能を維持できるインスタンスセグメンテーションは可能か?
  • RQ2深層学習を用いて、インスタンスラベリングの本質的な曖昧さ(商空間)を効果的にモデル化できるか?
  • RQ3完全畳み込みでセグメンテーションに特化したフレームワークは、オブジェクト中心およびテクスチャ中心の両データセットに一般化可能か?
  • RQ4ピクセルレベル、スーパーピクセルレベル、境界ベースのアフィニティ学習の相対的な利点は何か?
  • RQ5変形しやすいオブジェクトを含むデータセットにおいて、提案手法は最先端の検出ベースのアプローチと比較してどうなるか?

主な発見

  • 提案手法は、MICCAI 2015 Glandセグメンテーションデータセットで最先端の性能を達成し、Part AではF1スコア0.897、オブジェクトDiceスコア0.893を記録。MNC や HyperColumn といった検出ベースの手法を上回った。
  • PASCAL VOC 2012では、F1スコア0.897、オブジェクトDiceスコア0.893を達成し、MNC や Xu et al. [38] といった検出ベースのモデルと同等またはそれを上回った。
  • 境界ベースのコンポonentセグメンテーション(手法3)はGlandデータセットで最高の性能を示し、オブジェクトハウスドルフスコア106.978を記録し、形状の類似性が優れていることを示した。
  • 本手法は、長方形のバウンディングボックスでは捉えきれない非剛性で著しく変形した腺構造を効果的に処理できるため、Glandデータセットでは検出ベースの手法を上回った。
  • 複雑な検出ベースのモデルと比較して、はるかに単純で透明性が高く、推論が速く、トレーニングも容易でありながら、高い精度を維持している。
  • 結果から、オブジェクト検出を排除した完全畳み込み型アフィニティベースの学習が、オブジェクト中心およびテクスチャ中心の両インスタンスセグメンテーションタスクにおいて実用的で効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。