Skip to main content
QUICK REVIEW

[論文レビュー] Pixel Objectness: Learning to Segment Generic Objects Automatically in Images and Videos

Bo Xiong, Suyog Dutt Jain|arXiv (Cornell University)|Aug 11, 2018
Visual Attention and Saliency Detection被引用数 5
ひとこと要約

本稿では、外観と運動の手がかりを統合した2ストリームの完全畳み込みネットワークを用いて、画像および動画内の一般化されたオブジェクトを自動でセグメンテーションするエンドツーエンドのディーブラーニングフレームワーク、Pixel Objectnessを提案する。この手法は、人為的アノテーションを一切用いずに、複数のベンチマークで最先端の性能を達成し、完全自動手法を著しく上回り、手動入力が不要な半教師あり手法と同等またはそれを上回る性能を発揮する。

ABSTRACT

We propose an end-to-end learning framework for segmenting generic objects in both images and videos. Given a novel image or video, our approach produces a pixel-level mask for all "object-like" regions---even for object categories never seen during training. We formulate the task as a structured prediction problem of assigning an object/background label to each pixel, implemented using a deep fully convolutional network. When applied to a video, our model further incorporates a motion stream, and the network learns to combine both appearance and motion and attempts to extract all prominent objects whether they are moving or not. Beyond the core model, a second contribution of our approach is how it leverages varying strengths of training annotations. Pixel-level annotations are quite difficult to obtain, yet crucial for training a deep network approach for segmentation. Thus we propose ways to exploit weakly labeled data for learning dense foreground segmentation. For images, we show the value in mixing object category examples with image-level labels together with relatively few images with boundary-level annotations. For video, we show how to bootstrap weakly annotated videos together with the network trained for image segmentation. Through experiments on multiple challenging image and video segmentation benchmarks, our method offers consistently strong results and improves the state-of-the-art for fully automatic segmentation of generic (unseen) objects. In addition, we demonstrate how our approach benefits image retrieval and image retargeting, both of which flourish when given our high-quality foreground maps. Code, models, and videos are at:http://vision.cs.utexas.edu/projects/pixelobjectness/

研究の動機と目的

  • 未学習のオブジェクトカテゴリに一般化可能な、カテゴリに依存しないピクセル単位のフォアグラウンドセグメンテーション手法の開発。
  • 外観と運動の手がかりを統合した1つのエンドツーエンドでトレーニング可能なディープネットワークを統合し、セグメンテーションのロバスト性を向上させること。
  • 画像レベルのラベルや弱教師あり動画など、弱教師ありデータに加え、限られた境界アノテーションを活用することで、高コストなピクセルレベルのアノテーションへの依存度を低減すること。
  • 静的または複雑なオブジェクトに対しても、人為的介入なしに完全自動でセグメンテーションを実現すること。
  • 高品質な自動フォアグラウンドマップを提供することで、画像検索やリターゲティングなどの下流タスクを改善すること。

提案手法

  • 2ストリームの完全畳み込みネットワークが、外観と運動特徴を別々に処理し、運動ストリームでは動画フレームのオプティカルフローを入力とする。
  • 複数スケールで外観と運動特徴を統合し、各ピクセルの前景/背景予測を行う統合的ピクセルワイドのオブジェクトネスマップを生成する。
  • 画像レベルのラベル、境界レベルのアノテーション、弱教師あり動画フレームの組み合わせを用いて、エンドツーエンドでモデルをトレーニングする。
  • 動画処理では、画像でトレーニングされたモデルから開始し、複数フレームにわたる共同最適化により時間的整合性を活用する。
  • 最終的なセグメンテーションマスクの空間的整合性を保証するため、構造的予測損失を用いる。
  • 弱教師あり(例:画像レベルのラベル)と限られた強教師あり(例:境界レベルのアノテーション)を組み合わせたデータ効率の良いトレーニング戦略を導入する。

実験結果

リサーチクエスチョン

  • RQ1カテゴリ固有の監視なしに、数千の未学習カテゴリのオブジェクトを自動でセグメンテーションできるディーブラーニングモデルは構築可能か?
  • RQ2外観と運動の手がかりを1つのディープネットワークに効果的に統合することで、動くオブジェクトおよび静的オブジェクトのセグメンテーション性能を向上させられるか?
  • RQ3画像レベルのラベルや弱教師あり動画などの弱教師ありデータが、高コストなピクセルレベルのアノテーションをどれだけ代替できるか?
  • RQ4人為的入力が一切不要な完全自動手法が、人為的介入を必要とする半教師ありまたはインタラクティブ手法を凌駆できるか?
  • RQ5外観と運動の両方を統合することで、単独で使用する場合と比較して、セグメンテーションの正確性がどの程度向上するか?

主な発見

  • DAVIS 2016ベンチマークでは、本手法はすべての完全自動手法を上回り、Jaccardスコア72.4%を達成し、次に優れた手法よりも10.5ポイント高いスコアを記録した。
  • YouTube-Objectsデータセットでは、Jaccardスコア58.3%を達成し、このデータセットで高い性能を示すNLC手法よりも25ポイント高いスコアを記録したが、NLCは同データセットで優れた性能を発揮しているにもかかわらずである。
  • Segtrack-v2データセットでは、NLCを除くすべての自動手法を上回り、低解像度で挑戦的な動画に対しても強力な性能を示した。
  • 統合モデルは、個別の外観ストリームおよび運動ストリームよりも顕著に性能を向上させ、複雑なシーンにおける両手がかりの相乗効果を実証した。
  • 人為的介入が必要な最先端の手法(MSK や IVID)よりも、正確性において優れており、人為的アノテーションを一切要しないにもかかわらず、その性能を上回った。
  • 定性的な結果から、外観の手がかりが失敗した場合や運動がノイズが多い場合でも、モデルがオブジェクトを正常にセグメンテーションできることを示し、現実世界の変動に強いことを強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。