Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly-Supervised Semantic Segmentation with Image-Level Labels: from Traditional Models to Foundation Models

Zhaozheng Chen, Qianru Sun|arXiv (Cornell University)|2023. 10. 19.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 이미지 레벨 레이블을 사용하는 전통적인 약한 지도 학습 세분화(WSSS) 방법을 조사하고, 텍스트 프롬프팅 및 제로샷 학습 설정에서 Segment Anything Model(SAM)의 WSSS 응용 가능성을 탐구한다. SAM이 전통적 방법을 크게 능가하며, 특히 실외 환경과 일반적인 물체 카테고리에서 인간 레이블링 수준을 초월하는 고품질의 가짜 마스크를 생성함을 입증한다.

ABSTRACT

The rapid development of deep learning has driven significant progress in image semantic segmentation - a fundamental task in computer vision. Semantic segmentation algorithms often depend on the availability of pixel-level labels (i.e., masks of objects), which are expensive, time-consuming, and labor-intensive. Weakly-supervised semantic segmentation (WSSS) is an effective solution to avoid such labeling. It utilizes only partial or incomplete annotations and provides a cost-effective alternative to fully-supervised semantic segmentation. In this journal, our focus is on the WSSS with image-level labels, which is the most challenging form of WSSS. Our work has two parts. First, we conduct a comprehensive survey on traditional methods, primarily focusing on those presented at premier research conferences. We categorize them into four groups based on where their methods operate: pixel-wise, image-wise, cross-image, and external data. Second, we investigate the applicability of visual foundation models, such as the Segment Anything Model (SAM), in the context of WSSS. We scrutinize SAM in two intriguing scenarios: text prompting and zero-shot learning. We provide insights into the potential and challenges of deploying visual foundational models for WSSS, facilitating future developments in this exciting research area.

연구 동기 및 목표

  • 이미지 레벨 레이블만을 사용하는 전통적 WSSS 방법의 종합적 서베이를 제공하고, 운영 수준에 따라 픽셀 수준, 이미지 수준, 교차 이미지 수준, 외부 데이터 수준으로 분류한다.
  • 제한된 지도 학습 하에서 시각 기초 모델—특히 SAM—이 약한 지도 학습 세분화에서의 타당성과 성능을 탐구한다.
  • 가짜 마스크 생성을 위한 두 가지 실용적 시나리오에서 SAM을 평가한다: 텍스트 입력(바운딩 박스 생성을 위해 Grounded DINO 사용) 및 제로샷 학습(클래스 태깅을 위해 RAM 사용)
  • 기초 모델이 WSSS에서 겪는 한계와 실패 케이스를 분석한다. 특히 애너테이션 전략의 괴리와 복잡한 실내 환경에 대한 영향을 중심으로 한다.
  • 기초 모델을 약한 지도 학습 세분화에 도입할 때의 주요 과제와 향후 연구 방향을 규명한다. 모델의 강인성 및 애너테이션 표준화를 포함한다.

제안 방법

  • 기존 WSSS 방법을 운영 수준에 따라 네 그룹으로 분류한다: 픽셀 수준(예: 손실 함수, 국소 패치), 이미지 수준(예: 적대적 학습, 일관성 정규화), 교차 이미지 수준(예: 다중 이미지 비교), 외부 데이터 수준(예: 주목도 맵, OOD 데이터).
  • 텍스트 입력 설정에서, 클래스 레이블에서 객체 바운딩 박스를 생성하기 위해 Grounded DINO 모델을 사용하며, 이를 SAM의 프롬프트로 활용해 세분화 마스크를 생성한다.
  • 제로샷 설정에서는 Recognise Anything Model(RAM)을 사용해 이미지 특징에서 클래스 레이블을 예측하고, 이를 SAM의 텍스트 프롬프트로 활용하여 클래스 특화 미세조정 없이도 마스크를 생성한다.
  • SAM의 프롬프트 기반 세분화 프레임워크를 활용해 텍스트 및 제로샷 클래스 임베딩을 사용하여 가짜 마스크를 생성하며, SA-1B에서의 대규모 사전 훈련을 유용하게 활용한다.
  • VOC 데이터셋에서 클래스별 및 실패 케이스 분석을 수행하여 마스크 품질을 평가하며, mIoU 및 모델 출력과 데이터셋 애너테이션 간의 시각적 괴리도 중심으로 분석한다.
  • mIoU 지표를 사용해 다양한 방법 간의 가짜 마스크 품질을 비교하고, 시각적 분석을 통해 프롬프트 기반 모델 또는 태깅 모델의 오류 또는 애너테이션 전략 불일치로 인한 실패 사례를 강조한다.
Figure 1 : The performance of recent WSSS works (CONTA [ 87 ] , IRN [ 1 ] , ReCAM [ 12 ] , AMN [ 41 ] , LPCAM [ 11 ] , and CLIP-ES [ 51 ] ) and an evaluation of foundation models on MS COCO [ 50 ] val set.
Figure 1 : The performance of recent WSSS works (CONTA [ 87 ] , IRN [ 1 ] , ReCAM [ 12 ] , AMN [ 41 ] , LPCAM [ 11 ] , and CLIP-ES [ 51 ] ) and an evaluation of foundation models on MS COCO [ 50 ] val set.

실험 결과

연구 질문

  • RQ1이미지 레벨 레이블만을 사용하는 전통적 WSSS 방법들이 픽셀 수준, 이미지 수준, 교차 이미지 수준, 외부 데이터 수준 등 다양한 운영 수준에서 성능 및 설계 측면에서 어떻게 비교되는가?
  • RQ2텍스트 프롬프트 또는 제로샷 방식으로 프롬프트가 주어졌을 때, Segment Anything Model(SAM)이 약한 지도 학습 세분화에서 고품질의 가짜 마스크를 효과적으로 생성할 수 있는가?
  • RQ3SAM의 주요 실패 모드는 무엇이며, 이는 프롬프트 기반 또는 태깅 모델의 성능과 어떻게 연관되어 있는가?
  • RQ4VOC와 같은 벤치마크 데이터셋의 애너테이션 전략이, 특히 복잡하거나 모호한 카테고리의 경우 가짜 마스크 품질 평가에 어떤 영향을 미치는가?
  • RQ5기초 모델인 SAM이 전통적 WSSS 방법을 얼마나 뛰어넘을 수 있으며, 실세계 약한 지도 학습 세분화에 적용할 때 남아 있는 과제는 무엇인가?

주요 결과

  • SAM(텍스트 입력)과 SAM(제로샷)은 가짜 마스크 품질에서 전통적 WSSS 방법을 크게 능가하며, mIoU 점수가 종종 완전 지도 학습 모델의 성능에 도달하거나 초월한다.
  • SAM(텍스트 입력)은 동물 및 교통 수단 관련 클래스에서 높은 mIoU를 기록하며, 배경이 단순한 실외 환경에서 더 나은 일반화 및 프롬프트 일치로 인해 성능이 뛰어나다.
  • 실내 환경과 물체 카테고리(예: 식탁, 자전거)에서는 배경이 복잡하거나 애너테이션 전략의 불일치(예: 빈 휠 세그먼트 생략, 테이블 위 물체 포함)로 인해 성능이 저하된다.
  • 실패 케이스의 대부분은 SAM 자체의 오류가 아니라 프롬프트 기반 모델(Grounded DINO) 또는 태깅 모델(RAM)의 오류에서 기인하며, 이는 파ip라인의 강인성이 상游 구성 요소에 의존함을 시사한다.
  • 클래스별 분석 결과, SAM(텍스트 입력)과 SAM(제로샷)은 경계 정확도 및 완전성 측면에서 인간 애너테이션 마스크를 뛰어넘는 가짜 마스크를 자주 생성한다.
  • 본 연구는 모델 기반 세분화와 데이터셋 애너테이션 프로토콜 사이에 중요한 격차가 있음을 규명하며, 평가 시 표준화되고 더 일관된 애너테이션 관행이 필요함을 강조한다.
Figure 2 : The pipeline of traditional methods and foundation models in WSSS. The dashed line means an optional step.
Figure 2 : The pipeline of traditional methods and foundation models in WSSS. The dashed line means an optional step.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.