Skip to main content
QUICK REVIEW

[論文レビュー] Weakly-Supervised Semantic Segmentation with Image-Level Labels: from Traditional Models to Foundation Models

Zhaozheng Chen, Qianru Sun|arXiv (Cornell University)|Oct 19, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

本論文は、画像ラベルのみを用いた従来の弱教師ありセマンティックセグメンテーション(WSSS)手法を調査し、テキストプロンプトとゼロショット学習の2つの設定において、Segment Anything Model(SAM)をWSSSに応用する可能性を検討している。実験の結果、SAMは従来手法を著しく上回り、特に屋外シーンや一般的なオブジェクトカテゴリにおいて、人間がアノテートした品質を上回る高品質な疑似マスクを生成していることが示された。

ABSTRACT

The rapid development of deep learning has driven significant progress in image semantic segmentation - a fundamental task in computer vision. Semantic segmentation algorithms often depend on the availability of pixel-level labels (i.e., masks of objects), which are expensive, time-consuming, and labor-intensive. Weakly-supervised semantic segmentation (WSSS) is an effective solution to avoid such labeling. It utilizes only partial or incomplete annotations and provides a cost-effective alternative to fully-supervised semantic segmentation. In this journal, our focus is on the WSSS with image-level labels, which is the most challenging form of WSSS. Our work has two parts. First, we conduct a comprehensive survey on traditional methods, primarily focusing on those presented at premier research conferences. We categorize them into four groups based on where their methods operate: pixel-wise, image-wise, cross-image, and external data. Second, we investigate the applicability of visual foundation models, such as the Segment Anything Model (SAM), in the context of WSSS. We scrutinize SAM in two intriguing scenarios: text prompting and zero-shot learning. We provide insights into the potential and challenges of deploying visual foundational models for WSSS, facilitating future developments in this exciting research area.

研究の動機と目的

  • 画像ラベルのみを用いた従来のWSSS手法を包括的に調査し、作業レベル(ピクセル単位、画像単位、クロス画像、外部データ)に基づいて分類すること。
  • 視覚基盤モデル(特にSAM)が限られた監視情報のもとで弱教師ありセマンティックセグメンテーションに有効に機能するかを検証すること。
  • 疑似マスク生成の2つの実用的シナリオ、すなわちテキスト入力(バウンディングボックス生成にGrounded DINOを用いる)とゼロショット学習(クラスタグ生成にRAMを用いる)におけるSAMの評価を行うこと。
  • 基盤モデルがWSSSにおいて示す限界と失敗事例を分析し、特にアノテーション戦略の不一致や複雑な屋内シーンに関する問題を特定すること。
  • 基盤モデルを弱教師ありセグメンテーションに実装するにあたっての主な課題と今後の研究方向性を同定すること。特にモデルの耐障害性とアノテーション基準の統一性が重要である。

提案手法

  • 作業レベルに基づき、従来のWSSS手法を4つのグループに分類する:ピクセル単位(例:損失関数、局所パッチ)、画像単位(例:敵対的学習、一貫性正則化)、クロス画像(例:複数画像間の比較)、外部データ(例:サルジェンシー地図、OODデータ)。
  • テキスト入力設定では、Grounded DINOモデルを用いてクラスラベルからオブジェクトのバウンディングボックスを生成し、それをSAMのプロンプトとして使用してセグメンテーションマスクを生成する。
  • ゼロショット設定では、Recognise Anything Model(RAM)を用いて画像特徴からクラスラベルを予測し、そのラベルをテキストプロンプトとしてSAMに供給することで、クラス固有のファインチューニングなしにマスクを生成する。
  • SAMのプロンプトベースのセグメンテーションフレームワークを活用し、テキストおよびゼロショットクラス埋め込みを用いて疑似マスクを生成する。これは、SA-1Bで大規模事前学習されたSAMの利点を最大限に活かしている。
  • VOCデータセットを用いてクラスごとの分析と失敗事例分析を実施し、mIoUとモデル出力とデータセットアノテーションの視覚的差異に注目してマスク品質を評価する。
  • mIoU指標を用いて各手法の疑似マスク品質を比較し、視覚的分析により、グランドトゥースやタグモデルの誤り、アノテーション戦略の不一致に起因する失敗を強調する。
Figure 1 : The performance of recent WSSS works (CONTA [ 87 ] , IRN [ 1 ] , ReCAM [ 12 ] , AMN [ 41 ] , LPCAM [ 11 ] , and CLIP-ES [ 51 ] ) and an evaluation of foundation models on MS COCO [ 50 ] val set.
Figure 1 : The performance of recent WSSS works (CONTA [ 87 ] , IRN [ 1 ] , ReCAM [ 12 ] , AMN [ 41 ] , LPCAM [ 11 ] , and CLIP-ES [ 51 ] ) and an evaluation of foundation models on MS COCO [ 50 ] val set.

実験結果

リサーチクエスチョン

  • RQ1画像ラベルのみを用いた従来のWSSS手法は、ピクセル単位、画像単位、クロス画像、外部データといった異なる作業レベルにおいて、性能と設計面でどのように比較されるか?
  • RQ2テキストプロンプトまたはゼロショットの形でプロンプトされた場合、Segment Anything Model(SAM)は弱教師ありセマンティックセグメンテーションの疑似マスクを高品質に効果的に生成できるか?
  • RQ3SAMのWSSSにおける主な失敗モードは何か?また、パイプラインにおけるグランドトゥース(Grounded DINO)やタグモデル(RAM)の性能とどのように関連しているか?
  • RQ4VOCのようなベンチマークデータセットのアノテーション戦略は、特に複雑または曖昧なカテゴリにおいて、疑似マスク品質の評価にどのように影響を与えるか?
  • RQ5基盤モデル(例:SAM)は、従来のWSSS手法をどの程度上回ることができるか?また、実世界の弱教師ありセグメンテーションに実装するにあたって残された課題は何か?

主な発見

  • SAM(テキスト入力)およびSAM(ゼロショット)は、従来のWSSS手法を著しく上回り、疑似マスク品質においてmIoUスコアが完全に教師ありモデルの水準に近づくか、それを超えることが示された。
  • SAM(テキスト入力)は、動物や輸送機器に関連するクラスにおいて高いmIoUを達成しており、背景が単純な屋外シーンで特に優れた汎化性能とプロンプト整合性を示している。
  • 屋内シーンや特定のオブジェクトカテゴリ(例:食事用テーブル、自転車)では、複雑な背景やアノテーション戦略の不一致(例:中空のホイール部品を除外する、テーブル上の物品を含める)により性能が低下する。
  • 失敗事例の多くは、SAM自体の問題ではなく、グランドトゥース(Grounded DINO)やタグモデル(RAM)の誤りに起因しており、パイプライン全体の耐障害性は上流のコンponentに依存していることが示された。
  • クラスごとの分析から、SAM(テキスト入力)およびSAM(ゼロショット)は、境界の正確性や完全性の観点から、人間がアノテートしたマスクを頻繁に上回る疑似マスクを生成していることがわかった。
  • 本研究では、モデルベースのセグメンテーションとデータセットのアノテーションプロトコルとの間に顕著なギャップが存在することを特定し、評価における標準的かつ一貫性のあるアノテーション慣行の必要性を強調した。
Figure 2 : The pipeline of traditional methods and foundation models in WSSS. The dashed line means an optional step.
Figure 2 : The pipeline of traditional methods and foundation models in WSSS. The dashed line means an optional step.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。