Skip to main content
QUICK REVIEW

[논문 리뷰] Threshold Matters in WSSS: Manipulating the Activation for the Robust and Accurate Segmentation Model Against Thresholds

Minhyun Lee, Dongseob Kim|arXiv (Cornell University)|2022. 03. 30.
Advanced Neural Network Applications인용 수 8
한 줄 요약

이 논문은 약한 지도 학습 세그멘테이션(WSSS)에서 클래스 활성화 맵(CAM) 이후의 전역 임계값 처리가 희박한 객체 커버리지가 아니라 핵심 성능 저하 요인임을 규명한다. 전역 임계값의 민감도 문제를 해결하기 위해, 각 픽셀 분류와 레이블 조건화를 통한 활성화 조작 네트워크(AMN)를 제안한다. 이는 전경 활성화 불균형을 감소시키고 전경-배경 활성화 갭을 증가시켜, 임계값 설정에 관계없이 안정적이고 고정밀도의 허위 마스크를 생성한다. 이로 인해 PASCAL VOC 2012에서 70.7%의 mIoU, MS COCO 2014에서 44.7%의 mIoU를 달성하여 기존 최고 성능을 경신한다.

ABSTRACT

Weakly-supervised semantic segmentation (WSSS) has recently gained much attention for its promise to train segmentation models only with image-level labels. Existing WSSS methods commonly argue that the sparse coverage of CAM incurs the performance bottleneck of WSSS. This paper provides analytical and empirical evidence that the actual bottleneck may not be sparse coverage but a global thresholding scheme applied after CAM. Then, we show that this issue can be mitigated by satisfying two conditions; 1) reducing the imbalance in the foreground activation and 2) increasing the gap between the foreground and the background activation. Based on these findings, we propose a novel activation manipulation network with a per-pixel classification loss and a label conditioning module. Per-pixel classification naturally induces two-level activation in activation maps, which can penalize the most discriminative parts, promote the less discriminative parts, and deactivate the background regions. Label conditioning imposes that the output label of pseudo-masks should be any of true image-level labels; it penalizes the wrong activation assigned to non-target classes. Based on extensive analysis and evaluations, we demonstrate that each component helps produce accurate pseudo-masks, achieving the robustness against the choice of the global threshold. Finally, our model achieves state-of-the-art records on both PASCAL VOC 2012 and MS COCO 2014 datasets.

연구 동기 및 목표

  • WSSS에서 성능 저하의 근본 원인이 CAM 커버리지의 희박성인지, 아니면 CAM 이후 전역 임계값 처리인지를 규명하는 것.
  • 각 이미지마다 최적의 임계값이 상이하여 전역 임계값이 일반화에 실패하는 이유를 분석하는 것.
  • 이미지별 임계값 조정 없이도 높은 품질의, 임계값에 강인한 허위 마스크를 생성할 수 있는 방법을 개발하는 것.
  • 활성화 맵을 조작하여 불균형을 줄이고 전경-배경 갭을 증가시킴으로써, 이미지 레이블만을 사용해도 WSSS에서 최고 성능을 달성하는 것.

제안 방법

  • 각 픽셀 분류 손실을 통해 두 수준의 활성화(전경은 1, 배경은 0)를 생성하는 활성화 조작 네트워크(AMN)를 제안한다.
  • 진짜 이미지 레이블과 일치하도록 허위 마스크 출력을 강제하는 레이블 조건화 모듈을 도입하여, 비타겟 클래스에 대한 잘못된 활성화를 방지한다.
  • 각 픽셀 분류를 통해 동일 객체 내에서 높은 분류 능력을 가진 영역와 낮은 분류 능력을 가진 부분을 동시에 보완한다.
  • 조작된 활성화 맵에 전역 임계값을 적용하여, 활성화 갭이 증가함에 따라 다양한 임계값 설정에서도 일관된 성능을 확보한다.
  • 모델을 세 단계로 훈련한다: 분류기 미세조정, AMN의 각 픽셀 손실과 레이블 조건화를 통한 훈련, 세그멘테이션 헤드의 파인튜닝.
  • 분류기에서 전역 평균 풀링(GAP)을 활용하지만, 평균 효과를 상쇄하기 위해 활성화 조작을 통해 임계값 민감도를 줄인다.

실험 결과

연구 질문

  • RQ1WSSS에서 성능 저하의 근본 원인이 CAM 커버리지의 희박성인지, 아니면 CAM 이후 전역 임계값 처리인가?
  • RQ2왜 전역 임계값은 이미지 간 일반화에 실패하며, 각 이미지마다 최적의 임계값이 어떻게 다를까?
  • RQ3활성화 맵을 조작하여 불균형을 줄이고 전경-배경 갭을 증가시키면, 임계값에 강인한 허위 마스크를 얻을 수 있는가?
  • RQ4각 픽셀 분류 손실과 레이블 조건화 모듈이 함께 허위 마스크의 품질과 강인성을 향상시킬 수 있는가?
  • RQ5제안된 AMN 방법은 PASCAL VOC 2012와 MS COCO 2014와 같은 표준 WSSS 벤치마크에서 최고 성능을 달성하는가?

주요 결과

  • CAM에 대한 최적의 임계값은 이미지 간에 크게 달라지며, PASCAL VOC 2012 훈련 세트에서 넓은 분포를 보여 전역 임계값이 비최적임을 시사한다.
  • 전역 임계값은 이미지에 따라 너무 희박하거나 너무 농후한 마스크를 생성할 수 있어 안정성이 떨어진다.
  • 제안된 AMN 방법은 MS COCO 미사전 학습 백본을 사용하여 PASCAL VOC 2012에서 70.7%의 mIoU를 달성하여, 이미지 레이블 기반 WSSS에서 새로운 최고 성능을 수립한다.
  • MS COCO 2014에서는 44.7%의 mIoU를 기록하여 역시 새로운 최고 성능을 달성하여 대규모 벤치마크에서의 효과를 확인한다.
  • 이전에 어려웠던 클래스들, 예를 들어 '식당 테이블'(37.5%에서 53.8%로 mIoU 향상)과 'TV'(54.9%에서 57.5%로 향상)에서도 성능 향상이 두드러져 활성화 불균형에 대한 강인함을 입증한다.
  • 정성적 결과에서는 전체 객체 커버리지가 향상되고 경계 오류가 감소한 것으로 나타나, 특히 복잡하거나 시각적으로 모호한 객체에서 유의미한 개선이 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.