Skip to main content
QUICK REVIEW

[論文レビュー] Semi-Supervised Semantic Segmentation with High- and Low-level Consistency

Sudhanshu Mittal, Maxim Tatarchenko|arXiv (Cornell University)|Aug 15, 2019
Advanced Image and Video Retrieval Techniques被引用数 8
ひとこと要約

本稿では、境界精錬に生成対抗ネットワーク(GAN)ベースの生成器を用い、グローバルなクラス一貫性を確保するための半教師付きマルチラベル分類ブランチを統合することで、低レベルおよび高レベルの一貫性を同時に最適化する二本のブランチからなる半教師付きセマンティックセグメンテーションフレームワークを提案する。本手法は、PASCAL VOC 2012で2%のラベル付きデータのみを用いても、先行手法より11%の性能向上を達成し、最先端の性能を実現した。

ABSTRACT

The ability to understand visual information from limited labeled data is an important aspect of machine learning. While image-level classification has been extensively studied in a semi-supervised setting, dense pixel-level classification with limited data has only drawn attention recently. In this work, we propose an approach for semi-supervised semantic segmentation that learns from limited pixel-wise annotated samples while exploiting additional annotation-free images. It uses two network branches that link semi-supervised classification with semi-supervised segmentation including self-training. The dual-branch approach reduces both the low-level and the high-level artifacts typical when training with few labels. The approach attains significant improvement over existing methods, especially when trained with very few labeled samples. On several standard benchmarks - PASCAL VOC 2012, PASCAL-Context, and Cityscapes - the approach achieves new state-of-the-art in semi-supervised learning.

研究の動機と目的

  • ラベル付きピクセル単位のアノテーションが限られている状況において、大量のラベルなしデータを活用することで、セマンティックセグメンテーションの課題に取り組むこと。
  • セグメンテーション予測における不正確な境界や一貫性のない表面といった低レベルのアーティファクトを低減すること。
  • 誤ったグローバルクラス割り当てといった高レベルの誤りを、マルチラベル一貫性によって軽減すること。
  • 自己学習とGANベースの精錬を用いることで、データが少ない状況でも一般化性能とロバスト性を向上させること。
  • PASCAL VOC 2012、PASCAL-Context、Cityscapesを含む複数のベンチマークで有効性を示すこと。

提案手法

  • GANベースのブランチ(s4GAN)は、セグメンテーションネットワークを生成器とし、特徴マッチング損失を用いることで、標準的なGAN損失ではなく、低レベルの詳細を精錬する。
  • 自己学習は、識別器の信頼度スコアを用いて、ラベルなし画像から高品質な仮ラベルを選択することで実施される。
  • 別個の半教師付きマルチラベル分類ブランチ(MLMT)は、アンサンブルベースのSSLを用いて画像レベルのクラス存在を予測し、予測におけるグローバル一貫性を強制する。
  • 二つのブランチは同時に学習され、MLMTブランチにより誤検出が低減され、クラスレベルの一貫性が向上する。
  • 訓練の安定化と識別器の過学習防止のため、特徴マッチング損失が使用される。
  • 利用可能な弱い画像レベルアノテーションを統合できるように設計されており、CRFの後処理なしに性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1二本のブランチアーキテクチャは、半教師付きセマンティックセグメンテーションにおける低レベルおよび高レベルの誤りを効果的に低減できるか?
  • RQ2識別器スコアに基づく自己学習は、データが少ない状況下で仮ラベルの品質をどのように向上させるか?
  • RQ3半教師付き学習を用いたマルチラベル分類は、セグメンテーション出力におけるグローバル一貫性をどの程度向上させるか?
  • RQ4訓練データの2–5%しか完全ラベルが与えられていない状況で、本手法は最先端のアプローチと比較してどのように性能を発揮するか?
  • RQ5本手法は、PASCAL VOC、PASCAL-Context、Cityscapesといった多様なデータセットにおいて、最小限の監視下でも一般化可能か?

主な発見

  • PASCAL VOC 2012で、2%のラベル付きデータでの学習において、本手法は、先行手法より11%の性能向上を達成し、新たな最先端性能を樹立した。
  • PASCAL VOC 2012で5%のラベル付きサンプルを用いた場合、追加の画像レベルアノテーションを活用することで、72.9 mIoUを達成し、前回の最先端手法を5.2%上回った。
  • MLMTブランチ単体でも、s4GANオンativeのベースラインより2%の性能向上を示しており、グローバルクラス一貫性の価値を裏付けた。
  • 自己学習により、識別器の出力安定性が向上し、図11の訓練ダイナミクスからも過学習を回避していることが示された。
  • ROC曲線(図12)から、MLMTベースの分類器は、標準のCNNベース分類器よりも誤検出率が低く、特に訓練を再開してからも優れた性能を示した。
  • 従来の手法とは異なり、CRFの後処理なしに優れた性能を発揮し、Cityscapes や PASCAL-Context を含む複数のデータセットに良好に一般化された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。