[論文レビュー] GETAM: Gradient-weighted Element-wise Transformer Attention Map for Weakly-supervised Semantic segmentation
本論文は、勾配重み付き要素別アテンションマップを用いて正確でクラス別の活性化マップを生成することで、従来のCAMsの部分的活性化や形状歪みの問題を克服する、最初のトランスフォーマー基盤の弱教師ありセマンティックセグメンテーションフレームワークであるGETAMを提案する。新規の二重バックプロパゲーション方式とサリエンシー・マップを用いた活性化に配慮したラベル補完を統合することで、PASCAL VOCおよびMS-COCOで最先端の性能を達成し、エンドツーエンドとマルチステージの両方のアプローチを上回る、単一ステージの学習パイプラインを実現する。
Weakly Supervised Semantic Segmentation (WSSS) is challenging, particularly when image-level labels are used to supervise pixel level prediction. To bridge their gap, a Class Activation Map (CAM) is usually generated to provide pixel level pseudo labels. CAMs in Convolutional Neural Networks suffer from partial activation ie, only the most discriminative regions are activated. Transformer based methods, on the other hand, are highly effective at exploring global context with long range dependency modeling, potentially alleviating the "partial activation" issue. In this paper, we propose the first transformer based WSSS approach, and introduce the Gradient weighted Element wise Transformer Attention Map (GETAM). GETAM shows fine scale activation for all feature map elements, revealing different parts of the object across transformer layers. Further, we propose an activation aware label completion module to generate high quality pseudo labels. Finally, we incorporate our methods into an end to end framework for WSSS using double backward propagation. Extensive experiments on PASCAL VOC and COCO demonstrate that our results beat the state-of-the-art end-to-end approaches by a significant margin, and outperform most multi-stage methods.m most multi-stage methods.
研究の動機と目的
- 弱教師ありセマンティックセグメンテーションにおけるクラス活性化マップ(CAMs)の限界、特に部分的活性化と形状局在の悪さを是正すること。
- ビジョントランスフォーマーのグローバルな文脈モデリングと長距離依存性を活用することで、WSSSにおけるその潜在的可能性を調査すること。
- トランスフォーマーレイヤー全体にわたる細粒度のクラス別オブジェクト活性化を捉える、新たなアテンション可視化手法を開発すること。
- サリエンシー・マップをガイドにした活性化に配慮したラベル補完を用いて、高品質な疑似セグメンテーションラベルを生成すること。
- 二重バックプロパゲーション機構を介してエンドツーエンド学習を可能にすることで、マルチステージアプローチと比較して簡素化されたパイプラインを実現すること。
提案手法
- 分類ヘッドの二乗勾配でクエリとキー行列のドット積を重みづけすることで、要素ごとのアテンションマップを計算する勾配重み付き要素別トランスフォーマー・アテンション・マップ(GETAM)を提案する。
- 複数のトランスフォーマーレイヤーにわたるアテンションマップの集約により、段階的に異なるオブジェクト部分を明らかにし、空間的一致性と形状の正確性を向上させる。
- GETAMの出力を市販のサリエンシー・マップと融合する活性化に配慮したラベル補完モジュールを導入し、フォアグラウンドマスクの最適化とバックグラウンドオブジェクトの発見を実現する。
- セグメンテーションヘッドとアテンションマップ生成プロセスの両方にバックプロパゲーションを伝搬する二重バックプロパゲーション機構を採用し、エンドツーエンド学習を可能にする。
- グローバルな受容 field と自己アテンション機構を活用して特徴表現を向上させるために、ViTハイブリッドバックボーンを用いる。
- 提案されたモジュールを介して生成された疑似ラベルと画像ラベルを用いて、エンドツーエンドで全フレームワークを学習し、マルチステージのパイプラインを回避する。
実験結果
リサーチクエスチョン
- RQ1ビジョントランスフォーマーは、CNNと比較して弱教師ありセマンティックセグメンテーションにおいて、より正確で完全なオブジェクト活性化マップを生成できるか?
- RQ2勾配情報は、局在精度を向上させ、ノイズを低減するために、自己アテンションマップにどのように効果的に統合できるか?
- RQ3複数のトランスフォーマーレイヤーからのアテンションマップを組み合わせることで、オブジェクトの異なる部分を明らかにし、形状再構築を改善できるか?
- RQ4サリエンシー・マップを用いた活性化に配慮したラベル補完は、標準的なCAMベースの手法と比較して、より高品質な疑似ラベルを生成できるか?
- RQ5ビジョントランスフォーマーを基盤とする単一ステージでエンドツーエンド学習可能なフレームワークを用いて、WSSSで最先端の性能を達成することは可能か?
主な発見
- PASCAL VOC 2012の検証セットでは71.7%のmIoUを達成し、以前のSOTA手法AALRを7.8ポイント上回った。
- MS-COCOデータセットでは36.4%のmIoUを達成し、エンドツーエンドのWSSS手法としてこのベンチマークで結果を報告した最初の手法であり、競争力のある性能を示した。
- PASCAL VOCにおいても、URやRIBといったマルチステージ手法を上回ったにもかかわらず、より単純な単一ステージパイプラインを採用しているため、その効率性と有効性が示された。
- ViT、DeiT、DeiT-Distilledといった異なるビジョントランスフォーマーバックボーンでSOTA性能を達成しており、アーキテクチャ選択に対して高いロバスト性を示した。
- 二重バックプロパゲーション機構により、従来のSOTA手法で用いられる複雑なマルチステージパイプラインを排除した効果的なエンドツーエンド学習が可能になった。
- 可視化結果から、従来のCAMsとは異なり、GETAMはより均一に活性化され、形状が保持されたアテンションマップを生成していることが明らかになった。CAMsはしばしば過剰に平滑化されており、特徴的な領域に集中している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。