Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Difference Detection for Weakly-Supervised Semantic Segmentation

Wataru Shimoda, ‪Keiji Yanai‬|arXiv (Cornell University)|Nov 4, 2019
Advanced Neural Network Applications参考文献 44被引用数 14
ひとこと要約

本論文は、粗い活性マップを正確なセグメンテーションマスクに改善するために使用されるマッピング関数(例:CRF や反復的再訓練)からのノイズを特定・除去することで、弱教師ありセマンティックセグメンテーションの性能を向上させる自己教師付き差分検出(SSDD)モジュールを提案する。入力マスクと出力マスクの差分を予測することで、ノイズに配慮した精緻化を可能にし、PASCAL VOC 2012 の検証セットで64.9%のmIoU、テストセットで65.5%のmIoUを達成した。これは、追加の教師信号を用いずに弱教師あり設定で新たな最先端性能を確立した。

ABSTRACT

To minimize the annotation costs associated with the training of semantic segmentation models, researchers have extensively investigated weakly-supervised segmentation approaches. In the current weakly-supervised segmentation methods, the most widely adopted approach is based on visualization. However, the visualization results are not generally equal to semantic segmentation. Therefore, to perform accurate semantic segmentation under the weakly supervised condition, it is necessary to consider the mapping functions that convert the visualization results into semantic segmentation. For such mapping functions, the conditional random field and iterative re-training using the outputs of a segmentation model are usually used. However, these methods do not always guarantee improvements in accuracy; therefore, if we apply these mapping functions iteratively multiple times, eventually the accuracy will not improve or will decrease. In this paper, to make the most of such mapping functions, we assume that the results of the mapping function include noise, and we improve the accuracy by removing noise. To achieve our aim, we propose the self-supervised difference detection module, which estimates noise from the results of the mapping functions by predicting the difference between the segmentation masks before and after the mapping. We verified the effectiveness of the proposed method by performing experiments on the PASCAL Visual Object Classes 2012 dataset, and we achieved 64.9\% in the val set and 65.5\% in the test set. Both of the results become new state-of-the-art under the same setting of weakly supervised semantic segmentation.

研究の動機と目的

  • CRF や反復的再訓練などのノイズを含むマッピング関数が弱教師ありセマンティックセグメンテーションの性能を低下させることを是正すること。
  • ノイズのある教師信号からの信頼性の低い予測を特定・フィルタリングすることで、弱教師ありセグメンテーションの精度を向上させること。
  • 入力マスクと出力マスクの差分をプロキシタスクとして活用する自己教師付き手法を開発し、ピクセル単位のアノテーションを一切不要とすることで、頑健な精緻化を誘導すること。
  • 弱教師ありセグメンテーションパイプラインのシード生成段階およびエンドツーエンド学習段階の両方において、SSDDモジュールの有効性を実証すること。

提案手法

  • SSDDモジュールは、マッピング関数(例:CRF やモデル推論)の前後におけるセグメンテーションマスクの差分を予測するように訓練され、これを自己教師信号として扱う。
  • 本手法は、マッピング関数がノイズを導入すると仮定し、差分マップを誤った予測を特定するためのプロキシとして利用する。
  • モデルは差分マップ内の予測可能(信頼性あり)な領域と予測不能(ノイズあり)な領域を区別し、信頼性のある成分のみに焦点を当てて精緻化を行う。
  • SSDDモジュールは2段階に統合される:(1) シード生成段階(例:PSA からの出力)におけるCRF出力の精緻化、(2) 完全教師ありネットワークを用いたエンドツーエンド学習段階における予測の精緻化。
  • 差分予測は、入力マスクと出力マスクを入力として受け取り、それらの間の変化を予測する軽量な畳み込みネットワークによって実行される。
  • 最終的なセグメンテーションマスクは、元のマスクに予測された差分を適用することで得られ、結果としてマッピング関数の出力をノイズ除去する。

実験結果

リサーチクエスチョン

  • RQ1自己教師付き差分検出は、マッピング関数からのノイズを特定・除去することで、弱教師ありセマンティックセグメンテーションの精度を向上させることができるか?
  • RQ2提案されたSSDDモジュールは、静的(シード生成)および動的(学習ループ)なセグメンテーションマスクの両方の精緻化においてどの程度効果的か?
  • RQ3本手法は、追加の教師信号を用いないCRF や反復的精緻化に依存する既存の弱教師ありアプローチを上回る性能を示すか?
  • RQ4追加のデータやアノテーションを一切使用せずに、SSDDモジュールは最先端性能を達成できるか?

主な発見

  • 提案されたSSDDモジュールは、PASCAL VOC 2012 の検証セットで64.9%のmIoU、テストセットで65.5%のmIoUを達成し、画像レベルの教師信号のみを用いた弱教師ありセマンティックセグメンテーションにおいて、新たな最先端性能を確立した。
  • 従来の最先端手法(PSA:63.7%テストmIoU、IRN:64.8%テストmIoU)を上回り、顕著な性能向上を示した。
  • 顕著な補助教師信号(例:サリエンシー地図、Web画像、インスタンスレベルアノテーション)を一切使用しないにもかかわらず、AISC(64.5%検証) や Shen ら(63.9%テスト)のような補助教師信号を用いた手法をも上回った。
  • シード生成段階と学習段階の両方におけるSSDDの統合により、一貫した性能向上が得られ、その汎用性と頑健性を確認した。
  • アブレーションスタディにより、自己教師付き差分検出がノイズを効果的に低減しており、モデルがCRF や反復的精緻化からの信頼性の低い予測を識別・是正できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。