Skip to main content
QUICK REVIEW

[論文レビュー] Learning Affinity from Attention: End-to-End Weakly-Supervised Semantic Segmentation with Transformers

Lixiang Ru, Yibing Zhan|arXiv (Cornell University)|Mar 5, 2022
Advanced Neural Network Applications被引用数 15
ひとこと要約

本稿は、トランスフォーマーを用いたエンド・ツー・エンドの弱教師ありセマンティックセグメンテーションフレームワークを提案し、多ヘッド自己注意特徴から信頼性の高いセマンティックアフィニティを学習するためのアテンションからアフィニティ(AFA)モジュールを導入するとともに、ランダムウォーク伝播を用いて偽ラベルを精緻化する。本手法は、PASCAL VOC 2012で66.0%のmIoU、MS COCO 2014で38.9%のmIoUを達成し、エンド・ツー・エンドのWSSSにおいて新たなSOTA性能を確立した。

ABSTRACT

Weakly-supervised semantic segmentation (WSSS) with image-level labels is an important and challenging task. Due to the high training efficiency, end-to-end solutions for WSSS have received increasing attention from the community. However, current methods are mainly based on convolutional neural networks and fail to explore the global information properly, thus usually resulting in incomplete object regions. In this paper, to address the aforementioned problem, we introduce Transformers, which naturally integrate global information, to generate more integral initial pseudo labels for end-to-end WSSS. Motivated by the inherent consistency between the self-attention in Transformers and the semantic affinity, we propose an Affinity from Attention (AFA) module to learn semantic affinity from the multi-head self-attention (MHSA) in Transformers. The learned affinity is then leveraged to refine the initial pseudo labels for segmentation. In addition, to efficiently derive reliable affinity labels for supervising AFA and ensure the local consistency of pseudo labels, we devise a Pixel-Adaptive Refinement module that incorporates low-level image appearance information to refine the pseudo labels. We perform extensive experiments and our method achieves 66.0% and 38.9% mIoU on the PASCAL VOC 2012 and MS COCO 2014 datasets, respectively, significantly outperforming recent end-to-end methods and several multi-stage competitors. Code is available at https://github.com/rulixiang/afa.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNN)ベースのエンド・ツー・エンドWSSS手法がグローバルなコンテキストを捉える能力に限界を示し、不完全なオブジェクト領域を生成するという問題を解決すること。
  • トランスフォーマーのグローバルモデリング能力を活用し、弱教師ありセマンティックセグメンテーションの初期偽ラベルをより包括的かつ整合性のあるものにすること。
  • 多ヘッド自己注意とセマンティックアフィニティの内在的整合性を活用し、偽ラベル精緻化のための信頼性の高いアフィニティマップを学習すること。
  • ピクセルに適応する精緻化モジュールを用いて低レベルの画像外観特徴を統合し、偽ラベルの局所的整合性と信頼性を高めること。
  • 複数段階のフレームワークに起因する複雑さを回避するシンプルでエンド・ツー・エンドの訓練パイプラインを構築すること。

提案手法

  • 画像レベルラベルのみを用いたエンド・ツー・エンドのトランスフォーマー基盤フレームワークを提案し、CNNの代わりにビジョントランスフォーマーバックボーンを採用して初期クラス活性化マップ(CAMs)を偽ラベルとして生成する。
  • 多ヘッド自己注意(MHSA)特徴から信頼性の高いセマンティックアフィニティを学習するためのアテンションからアフィニティ(AFA)モジュールを導入し、偽ラベルを教師として用いてアテンションベースのアフィニティ予測を精緻化する。
  • 学習されたアフィニティを用いたランダムウォーク伝播を用いて初期偽ラベルを精緻化し、オブジェクト領域の完全性を向上させるとともに、誤検出を抑制する。
  • 局所的なRGBおよび位置特徴を統合するピクセルに適応する精緻化(PAR)モジュールを設計し、偽ラベルを低レベルの画像構造にさらに適合させる。
  • AFAモジュールの出力アフィニティを用いてラベル伝播をガイドすることで、グローバルな整合性を保ちつつ、PARによって局所的詳細を維持する。
  • モデル全体をエンド・ツー・エンドで訓練し、別々の訓練段階を必要とせず、パイプラインの簡素化を実現する。
Figure 1: (a) Image and the query points (denote with ” $\bigstar$ ”) to visualize the attention and affinity maps; (b) the self-attention maps in Transformer blocks only capture coarse semantic-level affinity relations; (c) the learned reliable semantic affinity from self-attention with our propose
Figure 1: (a) Image and the query points (denote with ” $\bigstar$ ”) to visualize the attention and affinity maps; (b) the self-attention maps in Transformer blocks only capture coarse semantic-level affinity relations; (c) the learned reliable semantic affinity from self-attention with our propose

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマーは、CNNよりもグローバルコンテキストをより効果的にモデル化することで、エンド・ツー・エンドの弱教師ありセマンティックセグメンテーションにおける初期偽ラベルの品質を向上させることができるか?
  • RQ2トランスフォーマーに内在する自己注意メカニズムを活用し、偽ラベル精緻化のための信頼性の高いセマンティックアフィニティを学習できるか?
  • RQ3アテンションベースのアフィニティ学習をどのようにして監視すれば、ラベル伝播に適した正確で信頼性の高いアフィニティマップを生成できるか?
  • RQ4低レベルの画像外観特徴を統合することで、精緻化された偽ラベルの局所的整合性と正確性を向上させられるか?
  • RQ5アテンションベースのアフィニティ学習を用いたエンド・ツー・エンドの訓練戦略は、標準ベンチマークにおいて、従来の複数段階およびエンド・ツー・エンドのWSSS手法を上回る性能を発揮するか?

主な発見

  • 提案手法は、PASCAL VOC 2012の検証セットで66.0%のmIoUを達成し、最近のエンド・ツー・エンド手法および多数の複数段階手法を顕著に上回った。
  • より挑戦的なMS COCO 2014データセットにおいても、検証セットで38.9%のmIoUを達成し、最近の多数の複数段階手法を上回り、エンド・ツー・エンドWSSSにおける新たなSOTAを樹立した。
  • VOC 2012では、完全に教師ありのSegformerベースラインの83.8%の性能を達成した。これは、弱教師ありの設定下でも高い効率性と有効性を示している。
  • アブレーションスタディの結果、AFAおよびPARモジュールの両方が性能向上に顕著な寄与をしていることが確認され、AFAはアフィニティ学習を向上させ、PARは局所的ラベル整合性を強化した。
  • 定性的な結果では、1Stage や AA&LR などのベースラインと比較して、本手法はより鋭い境界適合とより完全なオブジェクト領域を有するセグメンテーションマップを生成した。
  • エンド・ツー・エンドの訓練戦略は効果的かつ効率的であり、従来のWSSSアプローチで一般的に見られる複雑な複数段階パイプラインを回避した。
Figure 2: CAM generated with (b) Transformers activates more integral regions than (a) CNN. Refining CAM with (c) coarse MHSA doesn’t work well, while (d) the learned affinity could remarkably improve the generated CAM.
Figure 2: CAM generated with (b) Transformers activates more integral regions than (a) CNN. Refining CAM with (c) coarse MHSA doesn’t work well, while (d) the learned affinity could remarkably improve the generated CAM.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。