Skip to main content
QUICK REVIEW

[論文レビュー] Learning Transferrable Knowledge for Semantic Segmentation with Deep Convolutional Neural Network

Seunghoon Hong, Junhyuk Oh|arXiv (Cornell University)|Dec 24, 2015
Domain Adaptation and Few-Shot Learning参考文献 35被引用数 10
ひとこと要約

本論文は、60種類の COCO カテゴからのセマンティックセグメンテーション知識を、PASCAL VOC 2012 における画像ラベルのみを用いて転移させることで、弱教師ありセマンティックセグメンテーションの性能を向上させる手法を提案する。アテンション機構を備えたデカップルドエンコーダ・デコーダアーキテクチャを導入し、カテゴリ固有のサリエンシーマップを生成することで、デコーダーが異なるカテゴリ間でセグメンテーション知識を活用できるようにし、最小限の弱教師あり学習で最先端の結果を達成した。

ABSTRACT

We propose a novel weakly-supervised semantic segmentation algorithm based on Deep Convolutional Neural Network (DCNN). Contrary to existing weakly-supervised approaches, our algorithm exploits auxiliary segmentation annotations available for different categories to guide segmentations on images with only image-level class labels. To make the segmentation knowledge transferrable across categories, we design a decoupled encoder-decoder architecture with attention model. In this architecture, the model generates spatial highlights of each category presented in an image using an attention model, and subsequently generates foreground segmentation for each highlighted region using decoder. Combining attention model, we show that the decoder trained with segmentation annotations in different categories can boost the performance of weakly-supervised semantic segmentation. The proposed algorithm demonstrates substantially improved performance compared to the state-of-the-art weakly-supervised techniques in challenging PASCAL VOC 2012 dataset when our model is trained with the annotations in 60 exclusive categories in Microsoft COCO dataset.

研究の動機と目的

  • 異なるカテゴリからのセグメンテーションアノテーションを活用することで、弱教師ありと完全教師ありのセマンティックセグメンテーションの性能差を縮小する。
  • 弱教師あり学習(画像ラベル)において、カテゴリ間でのセグメンテーション知識の転送を課題とする。
  • ターゲットデータセット(例:PASCAL VOC)にピクセルレベルのアノテーションが不要な状態で、ソースカテゴリ(例:COCO)からターゲットカテゴリへの有効な知識転送を可能にするモデルアーキテクチャを開発する。
  • 関連しないカテゴリからの補助的セグメンテーションデータを活用することで、低教師あり環境におけるセグメンテーション精度を向上させる。
  • アテンションベースの特徴強調が、直接的な特徴伝搬よりも、セマンティックカテゴリ間でのセグメンテーション知識の一般化を向上させることを示す。

提案手法

  • 入力画像を処理するエンコーダと、セグメンテーションマスクを生成するデコーダからなるデカップルドエンコーダ・デコーダアーキテクチャを設計する。
  • 各クラスの関連する空間領域に注目することで、カテゴリ固有のサリエンシーマップを生成するアテンションモジュールを導入する。
  • 60種類の COCO カテゴのセグメンテーションアノテーションを用いてデコーダーを学習させ、汎用的なセグメンテーションパターンを習得する。
  • アテンションマップを動的ガイドとして用い、推論時における未学習カテゴリに対しても関連領域に注目できるようにする。
  • 特徴抽出に完全畳み込みネットワーク(FCN)バックボーンを適用し、アテンション機構の入力として最終分類スコアマップを用いる。
  • 境界の精緻化を図るために、後処理として条件付きランダムフィールド(CRF)を適用し、局所化精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1COCO のようなカテゴリ群からのセグメンテーション知識が、画像ラベルのみを用いた PASCAL VOC のような別のカテゴリ群における弱教師ありセグメンテーションの性能向上に効果的に転送可能か。
  • RQ2直接的な特徴伝搬と比較して、アテンションベースの特徴強調は、カテゴリ間でのセグメンテーション知識の転送性をどのように向上させるか。
  • RQ3ソースアノテーションの数が、ターゲットデータセットにおける弱教師ありセグメンテーションモデルの性能に及ぼす影響はどの程度か。
  • RQ4多様なソースカテゴリで学習したモデルは、微調整や追加アノテーションなしに、未学習のターゲットカテゴリに一般化可能か。
  • RQ5ノイズや誤った画像ラベルに対しても、本手法はベースラインの弱教師ありアプローチと比較して、セグメンテーション精度とロバスト性に優れているか。

主な発見

  • 本手法は、画像ラベルと60種類の COCO カテゴからのアノテーションのみを用いて、PASCAL VOC 2012 ベンチマークで最先端の性能を達成した。
  • アテンション機構を欠如させる DecoupledNet† や BaselineNet といったベースライン手法よりも優れた性能を示し、空間的アテンションの知識転送への重要性を実証した。
  • COCO アノテーションのわずか1%のデータでも、既存の弱教師あり手法と比較して優れた性能を維持しており、高いデータ効率性を示した。
  • BaselineNet が使用するスパースなクラススコアマップに比べ、アテンションマップはより密で情報量の多い表現を提供し、より正確で完全なセグメンテーションを実現した。
  • CRF の後処理統合により、特にオブジェクト境界の精緻化が図られ、セグメンテーション品質が向上した。
  • 本手法は誤分類やノイズのあるアテンション出力に対してもロバストであるが、稀に誤った予測を生じる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。