Skip to main content
QUICK REVIEW

[論文レビュー] All you need are a few pixels: semantic segmentation with PixelPick

Gyungin Shin, Weidi Xie|arXiv (Cornell University)|Apr 13, 2021
Domain Adaptation and Few-Shot Learning参考文献 71被引用数 5
ひとこと要約

この論文では、わずかなスパARSEなピクセルアノテーションのみを用いて最先端の性能を達成する、セマンティックセグメンテーションのための新しいアクティブラーニングフレームワーク、PixelPickを提案する。モデルが予測するピクセル提案とマウスフリーのアノテーションインターフェースを活用することで、CamVid、Cityscapes、Pascal VOC 2012のベンチマークにおいて、アノテーションコストを最大100倍まで削減しながら高い精度を維持する。

ABSTRACT

A central challenge for the task of semantic segmentation is the prohibitive cost of obtaining dense pixel-level annotations to supervise model training. In this work, we show that in order to achieve a good level of segmentation performance, all you need are a few well-chosen pixel labels. We make the following contributions: (i) We investigate the novel semantic segmentation setting in which labels are supplied only at sparse pixel locations, and show that deep neural networks can use a handful of such labels to good effect; (ii) We demonstrate how to exploit this phenomena within an active learning framework, termed PixelPick, to radically reduce labelling cost, and propose an efficient "mouse-free" annotation strategy to implement our approach; (iii) We conduct extensive experiments to study the influence of annotation diversity under a fixed budget, model pretraining, model capacity and the sampling mechanism for picking pixels in this low annotation regime; (iv) We provide comparisons to the existing state of the art in semantic segmentation with active learning, and demonstrate comparable performance with up to two orders of magnitude fewer pixel annotations on the CamVid, Cityscapes and PASCAL VOC 2012 benchmarks; (v) Finally, we evaluate the efficiency of our annotation pipeline and its sensitivity to annotator error to demonstrate its practicality.

研究の動機と目的

  • セマンティックセグメンテーションにおける高コストなピクセル単位のアノテーションを軽減するため、最小限の人的入力でスパARSEラベルを探索すること。
  • マウス操作を最小限に抑える実用的で効率的なアノテーションパイプラインを構築し、局所化タスクから分類タスクへと移行すること。
  • 低アノテーション予算下でのアノテーションの多様性、モデル容量、サンプリング戦略の影響を評価すること。
  • 深層畳み込みニューラルネットワークが、わずかな適切に選択されたピクセルラベルのみで強力なセグメンテーション性能を達成できることを示すこと。
  • 実際の現場での展開状況、特にアノテーターの誤りを含む状況において、提案フレームワークのロバスト性と効率性を検証すること。

提案手法

  • 不確実性サンプリング(例:マージンサンプリング)に基づき、モデルが反復的に最も情報量の多いピクセル位置を選択するアクティブラーニングフレームワークを提案する。
  • アノテーターがマウスで空間的位置を特定する必要をなくすために、モデルが予測するピクセル座標をクエリの提案として用いる。
  • アノテーターがマウス操作を一切行わず、1回のキーボード入力で事前に提案されたピクセルを分類するマウスフリーのアノテーションインターフェースを採用する。
  • スパARSEラベルでセグメンテーションモデル(例:ResNet50を搭載したFPN)を学習し、各ラウンドで最も不確実性の高いピクセルを再クエリする。
  • 異なるオブジェクトクラスや空間的領域にわたるカバレッジを確保するために、多様性に配慮したサンプリング戦略を適用する。
  • 実際のエラーを想定し、ラベルノイズの影響を考慮するロバストなトレーニングプロトコルを統合する。

実験結果

リサーチクエスチョン

  • RQ1どれほど少ないピクセルアノテーションで、競争力のあるセマンティックセグメンテーション性能を達成できるか?
  • RQ2固定されたアノテーション予算下で、不確実性や多様性などのサンプリング戦略のうち、どの戦略が最も優れた性能を示すか?
  • RQ3マウスフリーのアノテーションインターフェースは、精度を損なわせることなく、著しくラベリング時間を短縮できるか?
  • RQ4モデル容量と事前学習の有無が、低アノテーション環境下での性能にどのように影響するか?
  • RQ5実際の現場で人為のアノテーションエラーが生じた場合、フレームワークの感度はどの程度か?

主な発見

  • PixelPickは、CamVid、Cityscapes、Pascal VOC 2012で、最先端の手法と同等のmIoU性能を達成しており、ピクセルアノテーション数を最大100倍まで削減可能である。
  • VOC12の検証セットにおいて、ResNet50バックボーンを用いたPixelPickは、たった1.5Kのフィンガーラベル(1画像あたり10ピクセル)で68.0%のmIoUを達成し、より大きな予算を要する多数の先行弱教師付き手法を上回った。
  • マウスフリーのアノテーションインターフェースにより、1画像あたり10ピクセルのアノテーションが10秒未塔で完了し、平均90%の精度(正解ラベルと比較)を達成した。
  • フレームワークはラベルノイズに対してロバストである:10%のラベルジッターを意図的に導入しても、性能低下はほとんど認められなかった。
  • マージンサンプリングは、ランダムサンプリングや他の獲得関数と比較して、低アノテーション環境下で一貫して優れた性能を示した。
  • より深いモデル(例:ResNet50)は、浅いモデルと比較して低アノテーション予算下でも一般化性能が優れており、データが限られた状況下でもモデル容量が有益であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。