[논문 리뷰] Calibrating Undisciplined Over-Smoothing in Transformer for Weakly Supervised Semantic Segmentation
이 논문은 약한 지도 학습 세그멘테이션을 위한 비전 트랜스포머에서의 무질서한 과도한 평균화 문제를 완화하기 위해 새로운 방법인 적응형 재활성화 메커니즘(AReAM)을 제안한다. 엔트로피 기반 가중치를 사용해 얕은 층의 어텐션을 통해 깊은 층의 유사도 행렬을 적응적으로 감시함으로써 AReAM은 배경 노이즈를 감소시키고 객체 정위를 향상시켜 표준 벤치마크에서 최신 기술 수준의 성능을 달성한다.
Weakly supervised semantic segmentation (WSSS) has recently attracted considerable attention because it requires fewer annotations than fully supervised approaches, making it especially promising for large-scale image segmentation tasks. Although many vision transformer-based methods leverage self-attention affinity matrices to refine Class Activation Maps (CAMs), they often treat each layer's affinity equally and thus introduce considerable background noise at deeper layers, where attention tends to converge excessively on certain tokens (i.e., over-smoothing). We observe that this deep-level attention naturally converges on a subset of tokens, yet unregulated query-key affinity can generate unpredictable activation patterns (undisciplined over-smoothing), adversely affecting CAM accuracy. To address these limitations, we propose an Adaptive Re-Activation Mechanism (AReAM), which exploits shallow-level affinity to guide deeper-layer convergence in an entropy-aware manner, thereby suppressing background noise and re-activating crucial semantic regions in the CAMs. Experiments on two commonly used datasets demonstrate that AReAM substantially improves segmentation performance compared with existing WSSS methods, reducing noise while sharpening focus on relevant semantic regions. Overall, this work underscores the importance of controlling deep-level attention to mitigate undisciplined over-smoothing, introduces an entropy-aware mechanism that harmonizes shallow and deep-level affinities, and provides a refined approach to enhance transformer-based WSSS accuracy by re-activating CAMs.
연구 동기 및 목표
- 약한 지도 학습 세그멘테이션을 위한 깊은 트랜스포머 층에서 성능 저하의 근본 원인을 규명하는 것.
- 연속적인 유사도 행렬에서의 무질서한 과도한 평균화가 전반적인 관계 붕괴와 배경 노이즈를 유발하는 핵심 요인임을 규명하는 것.
- 얕은 층의 전역 관계를 사용해 깊은 층 어텐션을 적응적으로 校정하는 메커니즘을 개발하는 것.
- 비의미적인 활성화를 억제함으로써 의사라벨 품질과 세그멘테이션 정확도를 향상시키는 것.
- 교정된 의미 기반 감시를 통해 다층 어텐션 맵의 효과적인 집합을 가능하게 하는 것.
제안 방법
- AReAM은 점진적으로 향상된 CAM의 평균 정규화된 역엔트로피를 사용해 서로 다른 층에 대해 적응적인 가중치를 할당한다.
- 엔트로피가 높은 층(더 균일하고 노이즈가 많은 어텐션)은 순방향 전파 시 낮은 가중치를 받으며, 영향력이 감소한다.
- 역전파 동안 가중치는 반전되어 고엔트로피 층을 강조함으로써 깊은 층에 대해 더 강력한 감시를 가능하게 한다.
- 얕은 유사도 행렬을 사용해 깊은 유사도 행렬을 감시함으로써 의미 있는 영역에 어텐션을 집중시키고 배경을 억제한다.
- 기존의 트랜스포머 기반 WSSS 프레임워크에 아키텍처 변경 없이 통합 가능하므로 플러그 앤 플레이 배포가 가능하다.
- 최종 세그멘테이션 예측은 모든 층의 교정된 유사도 행렬을 집계하여 생성된다.

실험 결과
연구 질문
- RQ1비전 트랜스포머에서 약한 지도 학습 세그멘테이션에 대해 깊은 층의 유사도 행렬에서의 무질서한 과도한 평균화가 어텐션 품질을 떨어뜨리는가?
- RQ2과도한 평균화가 깊은 층에서 얼마나 심각하게 배경 노이즈와 완전하지 않은 객체 활성화를 유발하는가?
- RQ3얕은 층의 전역 관계가 깊은 층 어텐션을 효과적으로 감시하여 과도한 평균화를 완화할 수 있는가?
- RQ4엔트로피 기반 적응 가중치는 어떻게 층 간 유사도 행렬의 교정을 향상시키는가?
- RQ5아키텍처 수정 없이 AReAM이 객체 정위 향상과 배경 억제를 동시에 향상시킬 수 있는가?
주요 결과
- PASCAL VOC 2012 데이터셋에서 AReAM은 66.4%의 mIoU를 달성하여 AReAM이 없는 기준선 대비 2.4% 절대 향상되었다.
- COCO-2017 데이터셋에서는 mIoU가 70.0%에서 70.4%로 향상되어 다양한 벤치마크에서 일관된 성능 향상을 보였다.
- 층별 분석 결과, AReAM 적용 시 MCTFormer의 8층에서 mIoU가 25% 향상되어 깊은 층에서의 효과성을 확인했다.
- 주의 맵에서 시각화한 결과, 특히 노이즈가 가장 두드러지는 깊은 층에서 배경 노이즈가 크게 감소한 것으로 나타났다.
- 모든 교정된 유사도 행렬을 집계한 결과, 최고의 단일 층을 사용한 것보다 더 높은 성능을 기록하여 AReAM의 상호보완적 이점을 입증했다.
- 적응적인 엔트로피 기반 가중치 메커니즘은 추가 파라미터나 학습 복잡도 없이도 효과적인 감시를 가능하게 했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.