Skip to main content
QUICK REVIEW

[論文レビュー] WebSeg: Learning Semantic Segmentation from Web Searches

Qibin Hou, Ming‐Ming Cheng|arXiv (Cornell University)|Mar 27, 2018
Advanced Neural Network Applications参考文献 32被引用数 8
ひとこと要約

WebSegは、キーワード検索によって取得したウェブ画像から弱教師ありセマンティックセグメンテーションを学習する手法を提案する。低レベルの手がかり(注目度、エッジ、過剰分割)を用いてプロキシアノテーションを生成し、ラベルノイズを処理するオンラインノイズフィルタリングモジュールを導入する。PASCAL VOC 2012で人為的アノテーションマスクを一切使用せずに57.0%のmIoUを達成し、完全にウェブから学習するという点で優れた性能を示している。

ABSTRACT

In this paper, we improve semantic segmentation by automatically learning from Flickr images associated with a particular keyword, without relying on any explicit user annotations, thus substantially alleviating the dependence on accurate annotations when compared to previous weakly supervised methods. To solve such a challenging problem, we leverage several low-level cues (such as saliency, edges, etc.) to help generate a proxy ground truth. Due to the diversity of web-crawled images, we anticipate a large amount of 'label noise' in which other objects might be present. We design an online noise filtering scheme which is able to deal with this label noise, especially in cluttered images. We use this filtering strategy as an auxiliary module to help assist the segmentation network in learning cleaner proxy annotations. Extensive experiments on the popular PASCAL VOC 2012 semantic segmentation benchmark show surprising good results in both our WebSeg (mIoU = 57.0%) and weakly supervised (mIoU = 63.3%) settings.

研究の動機と目的

  • セマンティックセグメンテーションにおけるピクセルレベルのアノテーションの高コストを、キーワード検索から得た freely 利用可能なウェブ画像を活用することで軽減すること。
  • キーワードに関連する画像に不要なオブジェクトが含まれる可能性があるため、ウェブクロールド画像におけるラベルノイズの課題を克服すること。
  • キーワードベースの画像検索と人為的アノテーションなしに、未学習のカテゴリに対してもゼロショットでセマンティックセグメンテーションを可能にする手法を開発すること。
  • 深層ネットワーク(例:DeepLab)に軽量なオンラインノイズフィルタリングブランチを導入し、ヒューリスティックな手がかりから得られるノイズの多いプロキシアノテーションに対して、モデルのロバスト性を向上させること。

提案手法

  • キーワード検索の結果から、人為的アノテーションマスクを一切必要としない、大規模かつ多様な画像セットをトレーニングデータとして取得する。
  • 注目度マップ(DSS)、エッジマップ(RCF)、過剰分割領域(MCG)といった低レベルの手がかりを用いて、カテゴリに依存しないプロキシ正例を生成する。これらの手がかりはトレーニングを必要としない。
  • 過剰分割領域における注目度値の平均をとることで、各画像の疑似アノテーション(プロキシアノテーション)を構築する。
  • 深層ネットワーク(例:DeepLab)に軽量なブランチとしてオンラインノイズフィルタリングモジュールを導入し、ノイズの多いまたは関係のない領域の予測を動的に抑制する。
  • ノイズの多いプロキシアノテーションを用いて、フィルタリングモジュールが最適化過程で誤検出を拒否するように、セグメンテーションネットワークをエンドツーエンドで学習する。
  • 2段階のトレーニング設定において、画像レベルの監視とフィルタリングモジュールを組み合わせることで弱教師あり学習を活用し、性能を顕著に向上させる。

実験結果

リサーチクエスチョン

  • RQ1キーワードベースのウェブ画像検索と人為的アノテーションマスクなしに、深層学習モデルは未学習のオブジェクトカテゴリに対して正確なセマンティックセグメンテーションを学習できるか?
  • RQ2注目度、エッジ、領域といった低レベルの手がかりから得られるプロキシアノテーションは、ウェブデータに内在するラベルノイズの影響を受けても、どのようにして効果的にセグメンテーションモデルの学習に活用できるか?
  • RQ3オンラインノイズフィルタリング機構は、ノイズの多いウェブ監視データ上で学習する際、モデルの一般化性能と性能をどの程度向上させられるか?
  • RQ4提案手法は、PASCAL VOC 2012のような標準ベンチマークにおいて、完全に教師ありまたは弱教師ありの最先端手法と比較して競争力のある性能を達成できるか?

主な発見

  • WebSegは、人為的アノテーションマスクを一切使用せず、ウェブ画像のみを用いてPASCAL VOC 2012ベンチマークで57.0%のmIoUを達成し、強力なゼロショット一般化性能を示した。
  • 弱教師あり学習(例:画像レベルラベル)を適用すると、mIoUは63.3%に向上し、ほとんどのカテゴリで他のすべての最先端手法を上回った。
  • オンラインノイズフィルタリングモジュールは、ロバスト性を顕著に向上させ、大規模でノイズの多いウェブデータから学習しながら、不要な領域での誤予測を抑制できるようにした。
  • 本手法はカテゴリに依存しない:注目度、エッジ、領域といった低レベルの手がかりは再トレーニングやファインチューニングなしに使用可能であり、新しいカテゴリへの迅速な適応が可能である。
  • アブレーションスタディの結果、プロキシアノテーション生成とノイズフィルタリング機構の両方が性能向上に不可欠であることが確認され、いずれかのコンponentを除外するとmIoUが顕著に低下した。
  • 弱教師あり設定において最先端の結果を達成し、最良のバージョン(WebSeg$^{oldsymbol{ op}}$)は21のカテゴリ中18で、すべての先行手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。