Skip to main content
QUICK REVIEW

[論文レビュー] Bottom-Up Top-Down Cues for Weakly-Supervised Semantic Segmentation

Qinbin Hou, Puneet K. Dokania|arXiv (Cornell University)|Dec 7, 2016
Advanced Neural Network Applications被引用数 4
ひとこと要約

本論文は、画像レベルのラベルのみを用いて弱教師ありセマンティックセグメンテーションを実現する手法を提案する。ボトムアップの注目マップとトップダウンの注目マップを活用し、EMベースの学習フレームワークの高効率な初期化を実現している。PASCAL VOC 2012で最先端の性能を達成し、境界ボックスやスクラッチ、CRFの後処理を一切不要とし、mIoUで前人を10%以上上回る。

ABSTRACT

We consider the task of learning a classifier for semantic segmentation using weak supervision in the form of image labels which specify the object classes present in the image. Our method uses deep convolutional neural networks (CNNs) and adopts an Expectation-Maximization (EM) based approach. We focus on the following three aspects of EM: (i) initialization; (ii) latent posterior estimation (E-step) and (iii) the parameter update (M-step). We show that saliency and attention maps, our bottom-up and top-down cues respectively, of simple images provide very good cues to learn an initialization for the EM-based algorithm. Intuitively, we show that before trying to learn to segment complex images, it is much easier and highly effective to first learn to segment a set of simple images and then move towards the complex ones. Next, in order to update the parameters, we propose minimizing the combination of the standard softmax loss and the KL divergence between the true latent posterior and the likelihood given by the CNN. We argue that this combination is more robust to wrong predictions made by the expectation step of the EM method. We support this argument with empirical and visual results. Extensive experiments and discussions show that: (i) our method is very simple and intuitive; (ii) requires only image-level labels; and (iii) consistently outperforms other weakly-supervised state-of-the-art methods with a very high margin on the PASCAL VOC 2012 dataset.

研究の動機と目的

  • ピクセルレベルのアノテーションではなく、画像レベルのラベルのみを用いたセマンティックセグメンテーションの課題に取り組む。
  • 境界ボックス、ポイント、スーパーピクセルなど、より高い監視信号に依存する既存の弱教師あり手法の限界を克服する。
  • 複雑で多数のオブジェクトを含むシーンに取り組む前に、単純な画像から学習することで、モデルの一般化性能と収束性を向上させる。
  • Eステップの誤った予測に起因する誤差を軽減するため、ソフトマックス損失とKLダイバージェンスを組み合わせた、強力なパラメータ更新戦略をMステップで開発する。

提案手法

  • 単純なImageNet画像から得られるクラスに依存しない注目マップ(ボトムアップ)と、クラス固有の注目マップ(トップダウン)を用い、初期モデル学習のための擬似正例マスクを生成する。
  • 1枚のオブジェクトのみを含むImageNet画像のフィルタリングされたサブセット上で、注目マップの組み合わせを監視信号として用い、初期セマンティックセグメンテーションモデルを学習する。
  • 期待最大化(EM)フレームワークを適用:Eステップでは、画像レベルのクラスラベルを用いてCNNの尤度を正則化し、確率質量が存在するクラスとバックグラウンドに制限されるようにする。
  • Mステップでは、標準的なソフトマックス交差エントロピーと、推定された潜在後確率とCNNの尤度との間のKLダイバージェンスを組み合わせたハイブリッド損失を最小化することで、耐性を高める。
  • CRFの後処理を回避し、完全に弱教師ありの状態を維持する。代わりに、画像ラベルのみを用いたエンドツーエンドの学習を実施する。
  • Eステップの初期化に基づき、複数回のEM反復を繰り返し、PASCAL VOC 2012におけるセグメンテーション精度を段階的に向上させる。

実験結果

リサーチクエスチョン

  • RQ1注目マップと注目マップを用いた単純でデータ効率の良い初期化は、弱教師ありセマンティックセグメンテーションの性能を顕著に向上させ得るか?
  • RQ2ボトムアップとトップダウンの両方の手がかりを組み合わせることで、単独で用いる場合よりも優れた擬似正例マスクの監視が得られるか?
  • RQ3Eステップの予測がノイズを含む状況下でも、ソフトマックス損失とKLダイバージェンスを組み合わせたハイブリッドMステップ損失を用いたEMフレームワークは、標準的なソフトマックスのみの学習を上回るか?
  • RQ4境界ボックスやより高い監視信号を一切使用せず、画像レベルラベルのみでPASCAL VOC 2012で最先端の性能を達成することは可能か?
  • RQ5単純な画像から最初に学習することで、弱教師ありセマンティックセグメンテーションにおける一般化性能と収束性がどのように向上するか?

主な発見

  • 提案手法は、PASCAL VOC 2012のテストセットで72.1%の平均交差率(mIoU)を達成し、以前の最先端手法(AugFeed)をほぼ10ポイント上回った。
  • CRFの後処理を一切行わない状態でも、CRFとより高い監視信号を用いた既存の最良手法を2.2%上回った。
  • 単に単純なImageNet画像から学習した初期モデルですら、現在の最先端手法をすべて上回る性能を示しており、単純な画像から学習することが有効であることを示している。
  • 注目マップと注目マップの組み合わせは、単独で用いる場合よりも正確な擬似正例マスクを生成しており、視覚的比較と定量的改善の両方で裏付けられている。
  • ハイブリッドMステップ損失(ソフトマックス + KLダイバージェンス)は、誤ったEステップ予測に対して耐性を示し、特にクラスの識別が困難または曖昧な場合に顕著に効果を発揮する。
  • 本手法は完全に弱教師ありの状態を維持しており、境界ボックス、スクラッチ、ピクセルレベルのアノテーションを一切必要とせず、大規模データにスケーラブルかつ実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。