Skip to main content
QUICK REVIEW

[論文レビュー] Uncertainty Estimation via Response Scaling for Pseudo-mask Noise Mitigation in Weakly-supervised Semantic Segmentation

Yi Li, Yiqun Duan|arXiv (Cornell University)|Dec 14, 2021
Advanced Neural Network Applications被引用数 5
ひとこと要約

本論文は、ノイズ低減のための応答スケーリングによる不確実性推定(URN: Uncertainty Estimation via Response Scaling for Noise mitigation)を提案する。この手法は、マルチスケールの応答マップスケーリングを用いて不確実性を推定することで、弱教師ありセマンティックセグメンテーションにおける疑似マスクのノイズを低減する。不確実性を活用してセグメンテーション損失を再重み付けすることで、追加のモデルやアノテーションを用いずに、PASCAL VOC 2012で71.2%のmIoU、MS COCO 2014で41.5%のmIoUという最先端の性能を達成した。

ABSTRACT

Weakly-Supervised Semantic Segmentation (WSSS) segments objects without a heavy burden of dense annotation. While as a price, generated pseudo-masks exist obvious noisy pixels, which result in sub-optimal segmentation models trained over these pseudo-masks. But rare studies notice or work on this problem, even these noisy pixels are inevitable after their improvements on pseudo-mask. So we try to improve WSSS in the aspect of noise mitigation. And we observe that many noisy pixels are of high confidence, especially when the response range is too wide or narrow, presenting an uncertain status. Thus, in this paper, we simulate noisy variations of response by scaling the prediction map multiple times for uncertainty estimation. The uncertainty is then used to weight the segmentation loss to mitigate noisy supervision signals. We call this method URN, abbreviated from Uncertainty estimation via Response scaling for Noise mitigation. Experiments validate the benefits of URN, and our method achieves state-of-the-art results at 71.2% and 41.5% on PASCAL VOC 2012 and MS COCO 2014 respectively, without extra models like saliency detection. Code is available at https://github.com/XMed-Lab/URN.

研究の動機と目的

  • 弱教師ありセマンティックセグメンテーション(WSSS)で生じる、不適切な応答スケールに起因する高信頼度のノイズピクセルを解消するという、長年の課題に取り組むこと。
  • 誤検出(フォールスポジティブ)と見逃し(マスキングポジティブ)が、それぞれ応答範囲が広すぎたり狭すぎたりするのと系統的に関連していること、つまり不確実性を反映していることを特定すること。
  • 活性化スケールの変動を模倣するための応答スケーリングに基づく、新しい不確実性推定メカニズムを提案すること。
  • 推定された不確実性を用いて損失を再重み付けすることで、トレーニング中のノイズの影響を軽減し、モデルのロバスト性を向上させること。
  • 顕著性検出器などの補助モデルに依存せずに、標準ベンチマークで最先端の性能を達成すること。

提案手法

  • 応答マップの複数のスケーリングバージョンを生成することで、活性化範囲の変動を模倣する。
  • 各画像に対して、応答マップを複数の要因(例:乗算スケーリング)でスケーリングし、多様な活性化パターンを生成する。
  • 不確実性推定の前に、スケーリングされた応答マップに密なCRFを適用して疑似マスク出力を精緻化する。
  • 複数のスケーリングされた応答マップ間の分散として不確実性を計算し、ノイズを示すピクセルレベルの不安定性を捉える。
  • 不確実性マップを正規化し、学習可能な損失重みとして使用することで、高不確実性(ノイズあり)ピクセルの最適化への寄与を低減する。
  • 不確実性重み付き損失と元の損失を乗算することで、再重み付け戦略を適用し、ノイズの多い監視の影響を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1弱教師ありセマンティックセグメンテーションにおいて、特に高信頼度の予測にノイズが現れる場合に、疑似マスク内の不確実性を効果的に推定する方法は何か?
  • RQ2応答スケールの変動が、疑似マスクにおける誤検出と見逃しの両者とどの程度相関しているか?
  • RQ3応答スケーリングによる不確実性推定は、トレーニング中の損失再重み付けによって、セグメンテーション性能を向上させることができるか?
  • RQ4本手法URMは、バックボーンやデータセットにわたる汎用性を考慮して、既存のノイズ低減戦略と比較してどの程度優れているか?
  • RQ5ノイズの多い疑似マスクの状況下で、確率に基づく重み付けと不確実性に基づく重み付けのどちらが優れているか?

主な発見

  • URNは、PASCAL VOC 2012のバリデーションセットで71.2%のmIoUを達成し、以前の最先端(SoTA)の70.0%を1.2ポイント上回った。
  • MS COCO 2014では41.5%のmIoUを達成し、顕著性検出器などの追加モデルを用いずに、新たな最先端の結果を樹立した。
  • 全テストバックボーンで性能向上を示し、ResNet-101では1.4%、ScaleNet-101では2.9%の向上を達成した。
  • アブレーションスタディの結果、不確実性に基づく再重み付け関数におけるしきい値t=0.05が最適な性能を示し、不確実なピクセルでさえ有用な情報を保持していることが示された。
  • 確率を損失重みとして用いた場合、Res2Net-101では70.5%のmIoUにとどまるが、URNでは71.2%を達成しており、不確実性推定がノイズ低減において確率よりも優れていることを証明した。
  • 疑似マスク distillation を用いることで、弱いバックボーンでは1.2–1.8%の性能向上が得られ、モデルデプロイメントにおける有効性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。