Skip to main content
QUICK REVIEW

[論文レビュー] Max Pooling with Vision Transformers reconciles class and shape in weakly supervised semantic segmentation

Simone Rossetti, Damiano Zappia|arXiv (Cornell University)|Oct 31, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

この論文では、Vision Transformers をベースにした、クラス活性マップ(CAM)の代わりにグローバル・マックス・プーリング(GMP)に基づくピクセルクラスマッピング(PCM)機構を採用する、新しいエンドツーエンド弱教師ありセマンティックセグメンテーション手法であるViT-PCMを提案する。ViTの局所的特徴表現を活用し、マルチラベルBCE損失を用いてピクセルごとのクラス関連性をエンドツーエンドで最適化することで、69.3%のmIoUをPascal VOC 2012の検証セットで達成。マルチステージの最適化を必要とせず、パrameter数も少ないにもかかわらず、最先端のCAMベース手法を上回る性能を発揮した。

ABSTRACT

Weakly Supervised Semantic Segmentation (WSSS) research has explored many directions to improve the typical pipeline CNN plus class activation maps (CAM) plus refinements, given the image-class label as the only supervision. Though the gap with the fully supervised methods is reduced, further abating the spread seems unlikely within this framework. On the other hand, WSSS methods based on Vision Transformers (ViT) have not yet explored valid alternatives to CAM. ViT features have been shown to retain a scene layout, and object boundaries in self-supervised learning. To confirm these findings, we prove that the advantages of transformers in self-supervised methods are further strengthened by Global Max Pooling (GMP), which can leverage patch features to negotiate pixel-label probability with class probability. This work proposes a new WSSS method dubbed ViT-PCM (ViT Patch-Class Mapping), not based on CAM. The end-to-end presented network learns with a single optimization process, refined shape and proper localization for segmentation masks. Our model outperforms the state-of-the-art on baseline pseudo-masks (BPM), where we achieve $69.3\%$ mIoU on PascalVOC 2012 $val$ set. We show that our approach has the least set of parameters, though obtaining higher accuracy than all other approaches. In a sentence, quantitative and qualitative results of our method reveal that ViT-PCM is an excellent alternative to CNN-CAM based architectures.

研究の動機と目的

  • 弱教師ありセマンティックセグメンテーション(WSSS)におけるCAMベース手法の限界、特に局所化精度と形状推定の悪さを是正すること。
  • Vision Transformers(ViT)が、特徴の局所性とグローバルなコンテキストを活かすことで、CAMのボトルネックを回避できるかどうかを検証すること。
  • マルチステージの最適化を必要とせず、疑似マスクの品質とクラスの局所化を同時に最適化できるシンプルでエンドツーエンドの手法を開発すること。
  • グローバル・マックス・プーリング(GMP)が、ViTのピクセル特徴をクラス関連領域にマッピングする能力を向上させ、セグメンテーション精度を向上させることを示すこと。
  • 最小限のパrameter数と後処理なしに、Pascal VOC 2012で最先端の性能を達成すること。

提案手法

  • グローバル・マックス・プーリング(GMP)を用いたピクセルクラスマッピング(PCM)ヘッドを導入し、CAMの代わりにViTベースのアーキテクチャを採用するViT-PCMを提案。各クラスごとに最も関連性の高いピクセル特徴を抽出する。
  • マルチラベルバイナリクロスエントロピー(BCE)損失を用いて、PCMヘッドをエンドツーエンドで学習し、画像ラベルから直接ピクセルレベルのクラス関連性を最適化する。
  • 共有重みを用いた二本のブランチ構造を採用し、トランスレーションおよびスケールの不変性を強化することで、疑似マスク予測の耐性を向上させる。
  • CRFを後処理として適用してベースライン疑似マスク(BPM)を精緻化するが、学習時にはCRFを使用せず、エンドツーエンドかつ軽量な手法を維持する。
  • 複雑なリファインメントヘッドや補助的監督を避けるために、可学習なアップサンプリング層を用いてViTのピクセル特徴をセグメンテーションマスクにマッピングする。
  • 特徴品質を向上させるために自己教師あり事前学習(DINO)を活用し、その後画像ラベルでエンドツーエンド微調整する。

実験結果

リサーチクエスチョン

  • RQ1Vision Transformers(ViT)は、CAMを用いるCNNと比較して、弱教師ありセマンティックセグメンテーションにおいて、より優れた局所化と形状推定を達成できるか?
  • RQ2グローバル・マックス・プーリング(GMP)は、ViTからクラス関連ピクセル特徴を効果的に抽出でき、CAMを排除した上で正確な疑似マスク生成を可能にするか?
  • RQ3シンプルでエンドツーエンドのViTベース手法は、画像ラベルのみで、複雑なマルチステージのCAMベース手法を上回ることができるか?
  • RQ4PCM機構は、mIoU、パrameter効率、さまざまなバックボーンにおける耐性の観点から、CAMと比較してどのように優れているか?
  • RQ5マルチステージの最適化や補助的監督(例:サリエンシー地図)を排除することで性能が低下するか、適切な特徴マッピングにより回避可能か?

主な発見

  • ViT-PCMは、画像ラベルとエンドツーエンド学習のみで、Pascal VOC 2012の検証セットで69.3%のmIoUを達成し、すべての先行SOTA手法を上回った。
  • CRFを後処理に組み込むと71.4%のmIoUを達成し、ベースライン疑似マスクの品質が優れていることを示した。
  • エンドツーエンドベンチマークでは、検証セットで70.3%、テストセットで70.9%のmIoUを達成し、一部のケースでマルチステージ手法をも上回った。
  • 競合手法と比較して顕著に少ないパrameter数を用いており、図5に示すように、すべてのSOTA手法の中で最も少ないパrameter数を記録した。
  • MS-COCO 2014データセットでも、検証セットで45.03%のmIoUを達成し、Pascal VOC以外のデータセットへの汎用性を示した。
  • アブレーションスタディの結果、すべてのバックボーンでPCMを用いたViT-PCMがCAMを上回り、特にViT-S/16では43.3%(PCM)vs. 29.3%(CAM)のmIoUという顕著な向上を示した。これにより、PCM機構の優位性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。