Skip to main content
QUICK REVIEW

[논문 리뷰] GETAM: Gradient-weighted Element-wise Transformer Attention Map for Weakly-supervised Semantic segmentation

Weixuan Sun, Jing Zhang|arXiv (Cornell University)|2021. 12. 06.
Advanced Neural Network Applications인용 수 12
한 줄 요약

이 논문은 분류 헤드의 제곱 미분을 사용해 그라디언트 가중 요소별 어텐션 맵을 가중하는 방식으로 정밀한 클래스별 활성화 맵을 생성함으로써 기존 CAMs의 부분적 활성화 및 형태 왜곡 문제를 해결하는, 처음으로 트랜스포머 기반의 약한 지도 학습 세그멘테이션 프레임워크인 GETAM을 제안한다. 새로운 듀얼 백워드 전파 방식과 샛기 맵을 기반으로 한 활성화 인식 레이블 보완 기법을 통합함으로써, PASCAL VOC 및 MS-COCO에서 최신 기술 수준(SOTA)의 성능을 달성하였으며, 단일 단계 학습 파이프라인을 통해 엔드 투 엔드 및 다단계 방법을 모두 능가한다.

ABSTRACT

Weakly Supervised Semantic Segmentation (WSSS) is challenging, particularly when image-level labels are used to supervise pixel level prediction. To bridge their gap, a Class Activation Map (CAM) is usually generated to provide pixel level pseudo labels. CAMs in Convolutional Neural Networks suffer from partial activation ie, only the most discriminative regions are activated. Transformer based methods, on the other hand, are highly effective at exploring global context with long range dependency modeling, potentially alleviating the "partial activation" issue. In this paper, we propose the first transformer based WSSS approach, and introduce the Gradient weighted Element wise Transformer Attention Map (GETAM). GETAM shows fine scale activation for all feature map elements, revealing different parts of the object across transformer layers. Further, we propose an activation aware label completion module to generate high quality pseudo labels. Finally, we incorporate our methods into an end to end framework for WSSS using double backward propagation. Extensive experiments on PASCAL VOC and COCO demonstrate that our results beat the state-of-the-art end-to-end approaches by a significant margin, and outperform most multi-stage methods.m most multi-stage methods.

연구 동기 및 목표

  • 약한 지도 학습 세그멘테이션에서 클래스 활성화 맵(CAMs)의 한계, 특히 부분적 활성화 및 낮은 형태 정밀도 문제를 해결하기 위해.
  • 시각 트랜스포머의 전역적 맥락 모델링 및 장거리 의존성 특성을 활용하여 WSSS에서의 잠재력을 탐색하기 위해.
  • 트랜스포머 레이어 전반에 걸쳐 세밀한 클래스별 객체 활성화를 포착하는 새로운 어텐션 시각화 방법을 개발하기 위해.
  • 샛기 맵을 기반으로 한 활성화 인식 레이블 보완 기법을 활용해 고품질의 가짜 세그멘테이션 레이블을 생성하기 위해.
  • 이중 백워드 전파 메커니즘을 통해 엔드 투 엔드 학습을 가능하게 하여 기존의 다단계 접근 방식에 비해 파이프라인을 단순화하기 위해.

제안 방법

  • 분류 헤드의 제곱 미분으로 쿼리 및 키 행렬의 내적을 가중하는 방식으로 요소별 어텐션 맵을 계산하는 Gradient-weighted Element-wise Transformer Attention Map(GETAM)을 제안한다.
  • 여러 트랜스포머 레이어의 어텐션 맵을 통합하여 점진적으로 다양한 객체 부분을 드러내어 공간 일관성과 형태 정확도를 향상시킨다.
  • GETAM 출력과 즉시 사용 가능한 샛기 맵을 융합하는 활성화 인식 레이블 보완 모듈을 도입하여 전경 마스크를 정밀화하고 배경 객체를 탐지한다.
  • 세그멘테이션 헤드와 어텐션 맵 생성 과정을 모두 거슬러 올라가는 백워드 전파 메커니즘을 활용해 엔드 투 엔드 학습을 가능하게 한다.
  • 더 나은 특징 표현을 위해 시각 트랜스포머의 전역 수신장과 자기 어텐션 메커니즘을 활용하는 ViT-Hybrid 백본을 사용한다.
  • 제안된 모듈을 통해 생성된 가짜 레이블과 이미지 수준의 레이블을 사용해 전체 프레임워크를 엔드 투 엔드로 학습하며, 다단계 학습 파이프라인을 피한다.

실험 결과

연구 질문

  • RQ1시각 트랜스포머는 CNN에 비해 약한 지도 학습 세그멘테이션에서 더 정확하고 완전한 객체 활성화 맵을 생성할 수 있는가?
  • RQ2그라디언트 정보를 어떻게 효과적으로 자기 어텐션 맵에 통합하여 정밀도를 향상시키고 노이즈를 줄일 수 있는가?
  • RQ3여러 트랜스포머 레이어의 어텐션 맵을 조합하여 객체의 다양한 부분을 드러내고 형태 복원을 향상시킬 수 있는가?
  • RQ4샛기 맵을 기반으로 한 활성화 인식 레이블 보완 기법은 기존 CAM 기반 방법에 비해 더 높은 품질의 가짜 레이블을 생성할 수 있는가?
  • RQ5시각 트랜스포머 기반의 단일 단계 엔드 투 엔드 학습 프레임워크로 WSSS에서 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • PASCAL VOC 2012 검증 세트에서 GETAM은 71.7% mIoU를 기록하며 이전 SOTA 방법인 AALR를 7.8%p 뛰어넘었다.
  • MS-COCO 데이터셋에서는 36.4% mIoU를 달성하여, 이는 경쟁력 있는 성능을 기록한 첫 번째 엔드 투 엔드 WSSS 방법이다.
  • 더 단순한 단일 단계 파이프라인을 사용함에도 불구하고, PASCAL VOC에서 URN 및 RIB 등의 다단계 방법을 뛰어넘어 효율성과 효과성을 입증했다.
  • ViT, DeiT, DeiT-Distilled 등 다양한 시각 트랜스포머 백본에서 최신 기술 수준 성능를 달성하여 아키텍처 선택에 대해 강건함을 보였다.
  • 이중 백워드 전파 메커니즘이 효과적인 엔드 투 엔드 학습을 가능하게 하여, 이전 SOTA 방법에서 사용된 복잡한 다단계 파이프라인의 필요성을 제거했다.
  • 시각화 결과에서 GETAM는 기존의 CAMs와 달리 더 균일하게 활성화되고 형태를 유지하는 어텐션 맵을 생성하는 것으로 나타났다. 기존 CAMs는 일반적으로 과도하게 부드럽게 처리되고 특징적인 영역에 집중되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.