Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly Supervised Semantic Segmentation using Out-of-Distribution Data

Jungbeom Lee, Seung‐June Oh|arXiv (Cornell University)|2022. 03. 08.
Advanced Image and Video Retrieval Techniques인용 수 6
한 줄 요약

이 논문은 약한 감독(semantic segmentation) 방법인 W-OoD를 제안하며, 분류기가 배경 특징(예: 기차와 궤도)과의 유사성을 잘못 인식하는 것을 방지하기 위해 '기차' 클래스에 대해 '궤도 전용' 이미지와 같은 강한 외부 분포(OoD) 이미지를 활용한다. 이러한 OoD 샘플을 거부하도록 분류기를 훈련시킴으로써 국소화 정확도를 향상시키며, 추가적인 레이블링 비용을 최소화하면서 Pascal VOC 2012에서 최고 성능을 달성한다.

ABSTRACT

Weakly supervised semantic segmentation (WSSS) methods are often built on pixel-level localization maps obtained from a classifier. However, training on class labels only, classifiers suffer from the spurious correlation between foreground and background cues (e.g. train and rail), fundamentally bounding the performance of WSSS. There have been previous endeavors to address this issue with additional supervision. We propose a novel source of information to distinguish foreground from the background: Out-of-Distribution (OoD) data, or images devoid of foreground object classes. In particular, we utilize the hard OoDs that the classifier is likely to make false-positive predictions. These samples typically carry key visual features on the background (e.g. rail) that the classifiers often confuse as foreground (e.g. train), so these cues let classifiers correctly suppress spurious background cues. Acquiring such hard OoDs does not require an extensive amount of annotation efforts; it only incurs a few additional image-level labeling costs on top of the original efforts to collect class labels. We propose a method, W-OoD, for utilizing the hard OoDs. W-OoD achieves state-of-the-art performance on Pascal VOC 2012.

연구 동기 및 목표

  • 약한 감독 세그멘테이션(WSSS)에서 분류기가 전경 객체와 배경 신호(예: 기차와 궤도) 사이에 잘못된 상관관계를 학습하는 근본적 한계를 해결한다.
  • 전경 클래스가 없는 대신 혼동스러운 배경 신호를 포함한 외부 분포(OoD) 데이터—즉, 전경 클래스가 없는 이미지—를 새로운 감독 소스로 식별하고 활용한다.
  • 표준 데이터셋 수집 파이프라인의 자연스러운 부산물인 OoD 데이터를 활용하여 레이블링 비용을 최소화하고, 몇 개의 추가 이미지 수준 레이블만으로도 가능하게 한다.
  • 메트릭 학습 목표를 통해 분류기가 내부 분포(in-distribution) 전경과 강한 OoD 샘플을 구분하도록 훈련시킴으로써, 허위 세그멘테이션 맵의 품질을 향상시킨다.
  • 작은 수의 강한 OoD 샘플(예: 클래스당 1개)만으로도 성능 향상이 뚜렷하게 나타나, 밀도 레이블링에 비해 비용 효율적인 대안이 될 수 있음을 입증한다.

제안 방법

  • 원래 데이터셋 셀렉션 과정에서 선택되지 않은 이미지에서 후보 OoD 이미지를 수집하며, 이는 자연스럽게 전경 클래스를 포함하지 않는다.
  • 사전 훈련된 분류기가 전경 클래스(예: '기차')에 대해 높은 신뢰도를 부여하는 이미지(예: 기차가 없는 궤도 전용 이미지)를 선택하여 강한 OoD 샘플을 식별한다.
  • 사람이 개입하는 정제 단계를 통해 전경 객체가 간혹 포함된 OoD 이미지를 제거하여 깔끔한 음성 감독을 확보한다.
  • 내부 분포 샘플과 OoD 샘플 간의 특징 거리를 증가시키는 메트릭 학습 손실을 사용하여, 모델이 잘못된 배경 신호를 거부하도록 유도한다.
  • 개선된 분류기를 이중 단계 WSSS 파이프라인에 통합한다: 먼저 CAM 변종을 통해 허위 세그멘테이션 마스크를 생성하고, 그 다음 개선된 마스크를 사용해 세그멘테이션 네트워크를 훈련시킨다.
  • 이중 손실 전략을 사용한다: 내부 분포 데이터에 대한 표준 크로스 엔트로피 손실과 내부 분포 및 강한 OoD 데이터에 모두 적용되는 대비 거리 손실($\mathcal{L}_{\text{d}}$)을 결합하여 특징 분리 능력을 향상시키고 훈련을 안정화시킨다.

실험 결과

연구 질문

  • RQ1외부 분포(OoD) 데이터는 약한 감독 세그멘테이션에서 잘못된 상관관계를 줄이기 위해 효과적인 감독 소스로 활용될 수 있는가?
  • RQ2분류기가 잘못된 전경 클래스를 예측하도록 유도하는 강한 OoD 샘플(예: 전경이 없는 이미지)을 포함할 경우, 허위 세그멘테이션 마스크의 품질에 어떤 영향을 미치는가?
  • RQ3WSSS에서 뚜렷한 성능 향상을 달성하기 위해 필요한 최소 레이블링 비용은 얼마이며, OoD 데이터는 낮은 레이블링 오버헤드로 대규모로 수집 가능한가?
  • RQ4OoD 데이터의 사용이 다양한 전경 클래스, 특히 강한 배경 상관관계가 있는 클래스들(예: 기차-궤도, 새-나무)에 대해 일반화 성능을 향상시키는가?
  • RQ5OoD 데이터에서의 메트릭 학습이 훈련을 안정화시키고 내부 분포 및 잘못된 배경 패tern 간의 특징 분리 능력을 향상시키는가?

주요 결과

  • W-OoD는 Pascal VOC 2012에서 기존의 이미지 수준 레이블 기반 WSSS 방법을 능가하는 최고 성능을 달성한다.
  • 클래스당 단 1개의 강한 OoD 이미지만 추가해도 평균 교차율(mIoU)이 2.0%p 향상되며, 높은 샘플 효율성을 입증한다.
  • 모델은 잘못된 배경 활성화를 감소시키며, t-SNE 시각화 결과는 훈련 과정에서 내부 분포와 OoD 이미지의 특징 간 분리도가 점점 커지는 것을 보여준다.
  • OoD 데이터에 대한 메트릭 학습 손실 $\mathcal{L}_{\text{d}}$ 는 성능 향상에 크게 기여하며, 강한 OoD에 적용했을 때 mIoU가 58.1%에서 60.1%로 상승한다.
  • 내부 분포 데이터에 $\mathcal{L}_{\text{d}}$ 를 적용했을 때 mIoU의 표준편차가 0.82에서 0.33으로 감소하여 훈련 안정성이 향상됨을 보여준다.
  • 강한 잘못된 상관관계가 있는 클래스들(예: '기차', '기차', '보트')에서 성능 향상이 가장 두드러지며, '식탁' 클래스는 마스크 노이즈로 인해 성능 저하를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.