Skip to main content
QUICK REVIEW

[논문 리뷰] ISIM: Iterative Self-Improved Model for Weakly Supervised Segmentation

Cenk Bircanoğlu, Nafiz Arıca|arXiv (Cornell University)|2022. 11. 22.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

이 논문은 이미지 수준의 애너테이션만을 사용하여 약한 감독 세분화에서 성능을 향상시키기 위해 반복적이고 자기 향상되는 인코더-디코더 모델인 ISIM을 제안한다. 이 모델은 조밀한 CRF를 통해 생성된 가짜 세분화 레이블을 사용하여 클래스 활성 맵(CAMs)을 향상시킨다. 수정된 교차 엔트로피 손실을 통해 분류와 세분화를 동시에 최적화함으로써, ISIM은 Pascal VOC 2012에서 최신 기술 수준(SOTA) 성능을 달성하여 이전 방법 대비 mIoU를 2.5% 향상시켰다.

ABSTRACT

Weakly Supervised Semantic Segmentation (WSSS) is a challenging task aiming to learn the segmentation labels from class-level labels. In the literature, exploiting the information obtained from Class Activation Maps (CAMs) is widely used for WSSS studies. However, as CAMs are obtained from a classification network, they are interested in the most discriminative parts of the objects, producing non-complete prior information for segmentation tasks. In this study, to obtain more coherent CAMs with segmentation labels, we propose a framework that employs an iterative approach in a modified encoder-decoder-based segmentation model, which simultaneously supports classification and segmentation tasks. As no ground-truth segmentation labels are given, the same model also generates the pseudo-segmentation labels with the help of dense Conditional Random Fields (dCRF). As a result, the proposed framework becomes an iterative self-improved model. The experiments performed with DeepLabv3 and UNet models show a significant gain on the Pascal VOC12 dataset, and the DeepLabv3 application increases the current state-of-the-art metric by %2.5. The implementation associated with the experiments can be found: https://github.com/cenkbircanoglu/isim.

연구 동기 및 목표

  • 약한 감독 세분화(WSSS)에서 클래스 수준의 레이블이 공간 정보를 제공하지 못하는 감독 갭을 해소하기 위해.
  • 암묵적인 이미지 콘텐츠를 활용하여 실제 세분화와의 일관성을 향상시키기 위해 클래스 활성 맵(CAMs)을 개선하기 위해.
  • 픽셀 수준의 애너테이션을 요구하지 않고도 반복적으로 가짜 세분화 레이블을 개선하고 CAMs를 향상시키는 반복적이고 자기 향상되는 프레임워크를 개발하기 위해.
  • 단지 이미지 수준의 감독과 표준 인코더-디코더 아키텍처를 사용하여 Pascal VOC 2012에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 이 프레임워크는 이미지 수준의 레이블만을 사용하여 분류와 세분화를 동시에 최적화하는 수정된 인코더-디코더 세분화 모델을 사용한다.
  • 조밀한 조건부 랜덤 필드(dCRF)를 사용하여 CAMs에서 가짜 세분화 마스크를 생성함으로써 객체 영역의 국소화와 완전성을 향상시킨다.
  • 학습 중에 픽셀 단위의 손실을 적용하여 CAMs를 가짜 세분화 레이블과 정렬함으로써 더 정확하게 전파되도록 한다.
  • 역전파를 통한 엔드 투 엔드 학습을 통해 반복적으로 CAMs와 세분화 예측을 향상시킨다.
  • 단일 네트워크 내에서 분류 헤드와 세분화 헤드 간의 특징 공유를 통해 다중 작업 학습을 지원한다.
  • 이 방법은 다양한 백본 아키텍처(예: ResNet, ResNeSt, DeepLabv2/v3)에 일반화 가능하다.

실험 결과

연구 질문

  • RQ1약한 감독 세분화에서 가짜 세분화 레이블의 반복적 개선이 클래스 활성 맵(CAMs)의 품질을 향상시킬 수 있는가?
  • RQ2실제 마스크가 없는 CAM 기반 세분화에서 조밀한 CRF 기반 후처리가 얼마나 효과적으로 향상될 수 있는가?
  • RQ3자기 향상되는 다중 작업 학습 프레임워크가 완전히 감독된 학습과 약한 감독 학습 간의 성능 격차를 어느 정도 메울 수 있는가?
  • RQ4제안된 반복 학습 방식이 이미지 수준의 레이블만을 사용하여 기존 최신 기술 수준(SOTA) 방법보다 Pascal VOC 2012에서 더 나은 성능을 내는가?

주요 결과

  • DeepLabv3와 ResNeSt-200 백본을 사용할 때 ISIM 프레임워크는 Pascal VOC 2012 테스트 세트에서 평균 교차율(mIoU) 72.94%를 달성했다.
  • ResNet-101을 백본으로 사용할 경우 ISIM은 테스트 세트에서 70.38% mIoU를 기록했으며, 추가로 사전 지도된 시각적 강조 지도 데이터를 사용한 이전 SOTA 방법을 초월했다.
  • 동일한 백본(ResNet-101)과 이미지 수준의 감독만을 사용할 때, 이전 방법 대비 mIoU를 2.5% 향상시켜 최신 기술 수준의 성능을 달성했다.
  • 제거 실험을 통해 dCRF와 픽셀 단위의 손실을 통한 반복적 개선이 CAM 품질과 세분화 정확도를 크게 향상시킨다는 것이 확인되었다.
  • 추가 데이터나 시각적 강조 지도 없이도 강력한 성능을 내었으며, 동일한 조건에서 EPS 및 SPML과 같은 방법들을 능가했다.
  • 제안된 방법은 ResNet-50, ResNet-101, ResNeSt-200를 포함한 다양한 백본 아키텍처에서 일반적이고 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.