Skip to main content
QUICK REVIEW

[論文レビュー] Calibrating Undisciplined Over-Smoothing in Transformer for Weakly Supervised Semantic Segmentation

Lechao Cheng, Liu, Zerun|arXiv (Cornell University)|May 4, 2023
Advanced Neural Network Applications被引用数 6
ひとこと要約

本稿では、弱教師付きセマンティックセグメンテーションにおけるビジョントランスフォーマーの不規則な過剰平滑化を軽減するための新規手法である適応的再活性化メカニズム(AReAM)を提案する。エントロピーに基づく重み付けを用いて浅層の注意機構を深層の類似度行列に適応的に監視することで、AReAMは背景ノイズを低減し、オブジェクトの局所化性能を向上させ、標準ベンチマークで最先端の性能を達成する。

ABSTRACT

Weakly supervised semantic segmentation (WSSS) has recently attracted considerable attention because it requires fewer annotations than fully supervised approaches, making it especially promising for large-scale image segmentation tasks. Although many vision transformer-based methods leverage self-attention affinity matrices to refine Class Activation Maps (CAMs), they often treat each layer's affinity equally and thus introduce considerable background noise at deeper layers, where attention tends to converge excessively on certain tokens (i.e., over-smoothing). We observe that this deep-level attention naturally converges on a subset of tokens, yet unregulated query-key affinity can generate unpredictable activation patterns (undisciplined over-smoothing), adversely affecting CAM accuracy. To address these limitations, we propose an Adaptive Re-Activation Mechanism (AReAM), which exploits shallow-level affinity to guide deeper-layer convergence in an entropy-aware manner, thereby suppressing background noise and re-activating crucial semantic regions in the CAMs. Experiments on two commonly used datasets demonstrate that AReAM substantially improves segmentation performance compared with existing WSSS methods, reducing noise while sharpening focus on relevant semantic regions. Overall, this work underscores the importance of controlling deep-level attention to mitigate undisciplined over-smoothing, introduces an entropy-aware mechanism that harmonizes shallow and deep-level affinities, and provides a refined approach to enhance transformer-based WSSS accuracy by re-activating CAMs.

研究の動機と目的

  • 弱教師付きセマンティックセグメンテーションにおける深層トランスフォーマーレイヤーの性能低下の根本的原因を解明すること。
  • 連続する類似度行列における不規則な過剰平滑化が、グローバル関係の崩壊と背景ノイズを引き起こす主な要因であることを特定すること。
  • 浅層のグローバル関係を用いて深層の注意機構を適応的に補正するメカニズムを開発すること。
  • 意味的に関係のない活性化を抑制することで、疑似ラベルの品質とセグメンテーションの正確性を向上させること。
  • 補正された意味的認識に基づく監視により、多層の注意マップを効果的に集約できること。

提案手法

  • AReAMは、順次強化されたCAMの平均正規化逆エントロピーを用いて、異なるレイヤーに適応的重みを割り当てる。
  • エントロピーが高いために一様でノイズが多い注意(より不規則)なレイヤーは、順伝播時に低い重みが割り当てられ、その影響が軽減される。
  • 逆反復伝搬では重みが逆転され、高エントロピーのレイヤーが強化され、深層への強い監視が可能になる。
  • 本手法は、浅層の類似度行列を用いて深層の類似度行列を監視し、背景ではなく意味的領域に注目するように促進する。
  • AReAMはアーキテクチャの変更なしに既存のトランスフォーマーベースのWSSSフレームワークに統合可能であり、プラグアンドプレイでの導入が可能である。
  • 最終的なセグメンテーション予測は、すべてのレイヤーにおける補正済み類似度行列の集約によって生成される。
Figure 1 . Visualization of attention map generation. The proposed AReAM enables the attention map to contract towards more semantic regions.
Figure 1 . Visualization of attention map generation. The proposed AReAM enables the attention map to contract towards more semantic regions.

実験結果

リサーチクエスチョン

  • RQ1深層類似度行列における不規則な過剰平滑化が、WSSSにおけるビジョントランスフォーマーの注意品質を低下させるか?
  • RQ2過剰平滑化は、深層における背景ノイズとオブジェクトの不完全な活性化をどの程度引き起こすか?
  • RQ3浅層のグローバル関係が、深層の注意機構を効果的に監視することで過剰平滑化を緩和できるか?
  • RQ4エントロピーに基づく適応的重み付けは、レイヤー間での類似度行列の補正をどのように改善するか?
  • RQ5AReAMは、アーキテクチャの変更なしに、オブジェクトの局所化と背景抑制の両方を向上させることができるか?

主な発見

  • PASCAL VOC 2012 データセットにおいて、AReAMは66.4%のmIoUを達成し、AReAMを適用しないベースラインと比べて2.4%の絶対的向上を示した。
  • COCO-2017 データセットでは、mIoUが70.0%から70.4%に向上し、ベンチマーク全体で一貫した向上を示した。
  • レイヤー別分析では、MCTFormerにおいてレイヤー8でmIoUが25%向上したことが確認され、AReAMが深層においても有効であることを裏付けた。
  • 可視化された注意マップから、特にノイズが顕著に現れる深層において、背景ノイズが顕著に低減されたことが確認された。
  • すべての補正済み類似度行列を集約することで、最良の1層のみを用いる場合よりも高い性能が得られ、AReAMの補完的利点を証明した。
  • 適応的エントロピーに基づく重み付け機構により、追加のパラメータや訓練の複雑さを増すことなく、効果的な監視が可能になった。
(a) Global gains with averaged Affinity Matrix.
(a) Global gains with averaged Affinity Matrix.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。