[논문 리뷰] Max Pooling with Vision Transformers reconciles class and shape in weakly supervised semantic segmentation
이 논문은 시각 트랜스포머 기반의 새로운 엔드 투 엔드 약한 지도 학습 세분화 방법인 ViT-PCM을 제안한다. 이 방법은 클래스 활성 맵(CAM) 대신 전역 최대 풀링(GMP) 기반의 패치-클래스 매핑(PCM) 메커니즘을 도입하여, ViT의 국소화된 특징 표현을 활용하고, 다중 레이블 BCE 손실을 통해 패치-클래스 관련성의 엔드 투 엔드 최적화를 실현한다. 이로 인해 Pascal VOC 2012 검증 세트에서 69.3% mIoU를 달성하며, 다중 단계 보정이 필요 없고 파rameter 수가 적은 점을 감안할 때 기존 CAM 기반 방법을 초월한다.
Weakly Supervised Semantic Segmentation (WSSS) research has explored many directions to improve the typical pipeline CNN plus class activation maps (CAM) plus refinements, given the image-class label as the only supervision. Though the gap with the fully supervised methods is reduced, further abating the spread seems unlikely within this framework. On the other hand, WSSS methods based on Vision Transformers (ViT) have not yet explored valid alternatives to CAM. ViT features have been shown to retain a scene layout, and object boundaries in self-supervised learning. To confirm these findings, we prove that the advantages of transformers in self-supervised methods are further strengthened by Global Max Pooling (GMP), which can leverage patch features to negotiate pixel-label probability with class probability. This work proposes a new WSSS method dubbed ViT-PCM (ViT Patch-Class Mapping), not based on CAM. The end-to-end presented network learns with a single optimization process, refined shape and proper localization for segmentation masks. Our model outperforms the state-of-the-art on baseline pseudo-masks (BPM), where we achieve $69.3\%$ mIoU on PascalVOC 2012 $val$ set. We show that our approach has the least set of parameters, though obtaining higher accuracy than all other approaches. In a sentence, quantitative and qualitative results of our method reveal that ViT-PCM is an excellent alternative to CNN-CAM based architectures.
연구 동기 및 목표
- CAM 기반 방법의 약한 지도 학습 세분화(WSSS)에서의 국소화 및 형상 추정 부족 문제를 해결하기 위해.
- 시각 트랜스포머(ViT)가 내재된 특징 국소성과 전역적 맥락을 활용해 CAM의 한계를 극복할 수 있는지 탐색하기 위해.
- 다중 단계 보정 없이 의사 마스크 품질과 클래스 국소화를 동시에 최적화하는 단순한 엔드 투 엔드 방법을 개발하기 위해.
- 전역 최대 풀링(GMP)이 ViT의 패치 특징을 클래스 관련 영역으로 매핑하는 데 기여하여 세분화 정확도를 향상시킬 수 있는지 입증하기 위해.
- 최소한의 파rameter와 후처리 부스팅 없이 Pascal VOC 2012에서 최고 성능을 달성하기 위해.
제안 방법
- 전역 최대 풀링(GMP)을 사용해 각 클래스별로 가장 관련성이 높은 패치 특징을 추출하는 패치-클래스 매핑(PCM) 헤드를 도입한 시각 트랜스포머 기반 아키텍처인 ViT-PCM을 제안한다.
- 이미지 수준의 레이블에서 픽셀 수준의 클래스 관련성을 직접 최적화하기 위해 다중 레이블 이진 교차 엔트로피(BCE) 손실을 사용해 PCM 헤드를 엔드 투 엔드로 학습시킨다.
- 번역 및 스케일 불변성을 강화하기 위해 공유 가중치를 가진 이중 브랜치 아키텍처를 사용하여 의사 마스크 예측의 정확도를 향상시킨다.
- 기본 의사 마스크(BPM)를 개선하기 위해 CRF를 후처리로 적용하지만, 학습 중에는 CRF를 사용하지 않아 방법이 엔드 투 엔드이자 경량화된 상태를 유지한다.
- 복잡한 보조 감독이나 정교한 보정 헤드 없이도, 학습 가능한 업샘플링 레이어를 통해 ViT 패치 특징을 세분화 마스크로 매핑한다.
- 특징 품질을 향상시키기 위해 자기지도 사전학습(DINO)을 활용하고, 이후 이미지 수준의 레이블을 사용해 엔드 투 엔드로 미세조정한다.
실험 결과
연구 질문
- RQ1시각 트랜스포머(ViT)가 CAM을 사용하는 CNN보다 약한 지도 학습 세분화에서 더 나은 국소화 및 형상 추정 성능을 낼 수 있는가?
- RQ2전역 최대 풀링(GMP)이 ViT에서 클래스 관련 패치 특징을 효과적으로 추출하여 CAM 없이 정확한 의사 마스크 생성이 가능한가?
- RQ3단순한 엔드 투 엔드 ViT 기반 방법이 이미지 수준의 감독만으로도 복잡한 다중 단계 CAM 기반 방법을 능가할 수 있는가?
- RQ4PCM 메커니즘이 mIoU, 파라미터 효율성, 다양한 백본에서의 강건성 측면에서 CAM과 비교해 어떻게 성능을 냈는가?
- RQ5다중 단계 보정이나 보조 감독(예: 선명도 지도)이 없이도 적절한 특징 매핑을 통해 성능 저하 없이 성능을 유지할 수 있는가?
주요 결과
- ViT-PCM는 이미지 수준의 레이블과 엔드 투 엔드 학습만으로 Pascal VOC 2012 검증 세트에서 69.3% mIoU를 달성하며, 모든 기존 최고 성능 방법을 능가한다.
- CRF 후처리를 적용한 경우 71.4% mIoU를 기록하여 기초 의사 마스크 품질이 뛰어나다는 것을 입증한다.
- 엔드 투 엔드 벤치마크에서 새로운 SOTA를 수립하였으며, 검증 세트에서 70.3% mIoU, 테스트 세트에서 70.9% mIoU를 기록하여 일부 경우에서 다중 단계 방법을 초월한다.
- 경쟁 방법들보다 훨씬 적은 파라미터를 사용하며, 그 중에서도 모든 SOTA 방법 중 가장 작은 파라미터 수를 기록하였다(그림 5 참조).
- MS-COCO 2014 데이터셋에서 ViT-PCM는 검증 세트에서 45.03% mIoU를 기록하여 Pascal VOC 외의 일반화 능력을 입증한다.
- 절단 분석 결과, ViT-PCM는 테스트한 모든 백본에서 CAM을 능가하며, 특히 ViT-S/16에서 가장 큰 성능 향상을 보였다(43.3% vs. 29.3% mIoU), 이는 PCM 메커니즘이 우월함을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.