Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised Image-specific Prototype Exploration for Weakly Supervised Semantic Segmentation

Qi Chen, Lingxiao Yang|arXiv (Cornell University)|2022. 03. 06.
Advanced Neural Network Applications참고 문헌 53인용 수 14
한 줄 요약

이 논문은 이미지 수준 레이블만을 사용하여 약한 지도 학습(semantic segmentation)을 위한 새로운 프레임워크인 Self-supervised Image-specific Prototype Exploration (SIPE)을 제안한다. SIPE는 구조 인식 시드 위치 설정과 배경 인식 프로토타입 모델링을 통해 이미지별 활성화 맵(IS-CAM)을 생성하는 이미지별 프로토타입 탐색(Image-specific Prototype Exploration, IPE)을 도입한다. 또한 일반 CAM과 IS-CAM을 정렬함으로써 특징 학습을 자가 지도하는 일반-특수 일致성(General-Specific Consistency, GSC) 손실을 도입한다. 이 방법은 PASCAL VOC 2012에서 58.6%의 mIoU, MS COCO 2014에서 53.2%의 mIoU를 기록하여 최신 기준 성능(SOTA)을 달성한다.

ABSTRACT

Weakly Supervised Semantic Segmentation (WSSS) based on image-level labels has attracted much attention due to low annotation costs. Existing methods often rely on Class Activation Mapping (CAM) that measures the correlation between image pixels and classifier weight. However, the classifier focuses only on the discriminative regions while ignoring other useful information in each image, resulting in incomplete localization maps. To address this issue, we propose a Self-supervised Image-specific Prototype Exploration (SIPE) that consists of an Image-specific Prototype Exploration (IPE) and a General-Specific Consistency (GSC) loss. Specifically, IPE tailors prototypes for every image to capture complete regions, formed our Image-Specific CAM (IS-CAM), which is realized by two sequential steps. In addition, GSC is proposed to construct the consistency of general CAM and our specific IS-CAM, which further optimizes the feature representation and empowers a self-correction ability of prototype exploration. Extensive experiments are conducted on PASCAL VOC 2012 and MS COCO 2014 segmentation benchmark and results show our SIPE achieves new state-of-the-art performance using only image-level labels. The code is available at https://github.com/chenqi1126/SIPE.

연구 동기 및 목표

  • 약한 지도 학습(semantic segmentation)에서 클래스 활성화 맵(CAM)이 분류 가능한 영역에만 집중하고 전체 객체 구조를 忽略하는 한계를 해결하기 위해.
  • 각 객체의 더 대표적이고 완전한 영역을 포괄하는 이미지별 프로토타입을 학습하여 국소화 완전성( localization completeness)을 향상시키기 위해.
  • 일반 CAM과 이미지별 IS-CAM 간의 일致성 손실을 통해 특징 표현을 향상시키기 위해.
  • 피그먼트 수준 레이블에 대한 의존도를 줄이고 오직 이미지 수준 애너테이션만을 사용하여 최신 기준 성능(SOTA)을 달성하는 프레임워크를 개발하기 위해.

제안 방법

  • 이미지별 프로토타입 탐색(IPE)은 두 단계로 구성된다: 첫째, 구조 인식 시드 위치 설정은 상하좌우 픽셀 간 의미 관계를 기반으로 안정적이고 공간적으로 일관된 영역을 식별한다. 둘째, 이러한 시드로부터 이미지별 프로토타입을 형성하여 특징과의 프로토타입 상관관계를 계산한다.
  • 배경 인식 프로토타입 모델링은 분류에 유용하지 않지만 정보가 풍부한 배경 특징을 포착하여 국소화의 강건성을 향상시킨다.
  • 일반-특수 일치성(GSC) 손실은 일반 CAM(분류기 가중치에서 유도)과 이미지별 IS-CAM 간의 정렬을 강제하여 특징 표현을 개선하는 자가 지도 신호를 제공한다.
  • 프레임워크는 계층적 특징을 사용하여 전경과 배경을 더 잘 모델링하며, 배경 프로토타입 모델링이 가짜 레이블의 품질을 향상시킨다.
  • 가짜 레이블은 임계값 설정 또는 추정된 배경 맵을 통해 생성되며, 계층적 특징과 BPM을 함께 사용할 경우, 임계값 기반 방법보다 성능이 뛰어나다.
  • 모델은 피그먼트 수준의 감독 없이도 자가 지도 일치 목표함수를 통해 엔드 투 엔드로 훈련되며, 국소화 맵의 반복적 개선이 가능하다.

실험 결과

연구 질문

  • RQ1약한 지도 학습(semantic segmentation)에서 클래스 중심 기반 CAM 대비 이미지별 프로토타입이 국소화 완전성을 향상시키는가?
  • RQ2구조 인식 시드 위치 설정이 고정 임계값 또는 argmax 기반의 시드 선택보다 대표적인 객체 영역을 더 잘 식별하는가?
  • RQ3배경 인식 프로토타입 모델링이 특징 표현을 향상시키고 국소화의 오진( false positives)을 줄이는 데 어느 정도 기여하는가?
  • RQ4일반 CAM과 IS-CAM 간의 자가 지도 일치성 손실이 특징 품질과 분할 정확도를 향상시키는가?
  • RQ5계층적 특징과 배경 프로토타입 모델링을 조합하면 저수준 특징만을 사용할 경우보다 더 나은 가짜 레이블 생성이 가능한가?

주요 결과

  • SIPE는 오직 이미지 수준 레이블만을 사용하여 PASCAL VOC 2012 벤치마크에서 58.6%의 mIoU를 기록하며 새로운 최신 기준 성능(SOTA)을 달성한다.
  • 이미지별 프로토타입을 통해 생성된 IS-CAM은 표준 CAM 대비 mIoU에서 2.1% 향상되어 더 나은 국소화 완전성을 입증한다.
  • 일반-특수 일치성(GSC) 손실은 IS-CAM만을 사용할 경우 대비 mIoU를 5.4% 향상시켜 자가 지도 특징 보정의 효과를 입증한다.
  • 제거 분석(ablation study)은 계층적 특징과 배경 프로토타입 모델링(BPM)을 조합할 경우 가장 높은 성능을 내며, 추정 기반 가짜 레이블이 임계값 기반보다 뛰어나다는 것을 확인한다.
  • 구조 인식 시드 위치 설정은 고정 임계값 및 argmax 기반 방법보다 일관되게 우수한 성능을 보이며, 최고 성능로 53.3% mIoU를 기록하는 반면, 제안된 방법은 58.6%에 도달한다.
  • 시각화 결과는 IS-CAM이 CAM보다 더 완전한 객체 영역을 활성화하고, 특히 GSC로 훈련했을 경우 더 선명한 배경 활성화를 보임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.