Skip to main content
QUICK REVIEW

[論文レビュー] Deep Extreme Cut: From Extreme Points to Object Segmentation

Kevis-Kokitsi Maninis, Sergi Caelles|arXiv (Cornell University)|Nov 24, 2017
Advanced Neural Network Applications参考文献 34被引用数 15
ひとこと要約

DEXTRは、畳み込みニューラルネットワーク(CNN)に追加されたガウス分布ヒートマップチャネルを用いて、極端な点(左端、右端、上端、下端のピクセル)を入力とすることで、正確なオブジェクトセグメンテーションを生成する深層学習手法を提案する。この手法は、インタラクティブ、動画、弱教師ありセグメンテーションの分野で最先端の性能を達成し、ユーザー入力の大幅な削減を実現しており、ボクシングボックスやスクリブルを用いる手法と比較して、4クリック時のIoUで最大10%の向上を達成している。

ABSTRACT

This paper explores the use of extreme points in an object (left-most, right-most, top, bottom pixels) as input to obtain precise object segmentation for images and videos. We do so by adding an extra channel to the image in the input of a convolutional neural network (CNN), which contains a Gaussian centered in each of the extreme points. The CNN learns to transform this information into a segmentation of an object that matches those extreme points. We demonstrate the usefulness of this approach for guided segmentation (grabcut-style), interactive segmentation, video object segmentation, and dense segmentation annotation. We show that we obtain the most precise results to date, also with less user input, in an extensive and varied selection of benchmarks and datasets. All our models and code are publicly available on http://www.vision.ee.ethz.ch/~cvlsegmentation/dextr/.

研究の動機と目的

  • 最小限のユーザー入力で、密な画像および動画セグメンテーションにおけるアノテーションコストを低減すること。
  • ボクシングボックスやスクリブルではなく、極端な点の監視を組み込むことで、セグメンテーションの精度を向上させること。
  • 教師ありモデルの学習に適した効率的で正確なマスクアノテーションを可能にすること。
  • インタラクティブ、動画、弱教師ありセグメンテーションのタスクの統合的かつ性能の向上を図ること。

提案手法

  • 本手法は、CNNの入力に、4つの極端な点(左、右、上、下)それぞれに中心を置いたガウス分布ヒートマップチャネルを追加する。
  • CNNは、これらの極端な点のヒートマップが提供する空間的コンテキストを活用して、正確なオブジェクトマスクを予測する。
  • 標準的なセグメンテーション損失関数を用いて、アノテーションマスクが付与されたデータセット上で、エンドツーエンドにモデルを学習する。
  • インタラクティブセグメンテーションでは、誤分類された領域に対してオンラインハード例マイニング(OHEM)を用いて、追加の境界クリックをもとにネットワークをファインチューニングする。
  • より多くの境界クリックを追加することで、4点を超える拡張も可能であり、セグメンテーションの精度を向上させられる。
  • 再現性と下流タスクへの統合を目的として、事前学習済みモデルとコードを公開している。

実験結果

リサーチクエスチョン

  • RQ1ボクシングボックスやスクリブルベースの手法と比較して、極端な点の監視がセグメンテーション精度を向上させるか?
  • RQ2極端な点のガイダンスは、インタラクティブおよび動画オブジェクトセグメンテーションの性能にどのように影響を与えるか?
  • RQ3DEXTRは、教師ありモデルの学習に適した高品質なアノテーションを生成できるか?
  • RQ4本手法は、モデルの性能を維持または向上させながら、ラベル付けコストを削減できるか?

主な発見

  • PASCAL VOC 2012の検証セットにおいて、DEXTRはたった4クリックで91.5%のIoUを達成し、2番目に優れた手法(RIS-Net)を10.8ポイント上回った。
  • Grabcutデータセットでは、DEXTRが4クリックで94.4%のIoUに達し、先行するインタラクティブ手法を著しく上回った。
  • アノテーションに使用した場合、DEXTRが生成するマスクは高い正確性を示し、教師ありアノテーションで学習したモデルと同等の性能を発揮するモデルの学習が可能になった。
  • 動画オブジェクトセグメンテーションにおいて、DEXTRはDAVIS 2016およびDAVIS 2017の優れた初期化を提供し、トラッキング精度を向上させた。
  • 完全なピクセルレベルのアノテーションと比較して、ラベル付けコストを10分の1に削減しながら、最先端の性能を維持した。
  • 5回目のクリックを追加する際、オンラインハード例マイニング(OHEM)が性能向上に不可欠であることが判明した。これは、困難なケースに焦点を当てた学習を可能にするからである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。