Skip to main content
QUICK REVIEW

[논문 리뷰] A Simple Baseline for Semi-supervised Semantic Segmentation with Strong Data Augmentation

Jianlong Yuan, Yifan Liu|arXiv (Cornell University)|2021. 04. 15.
Advanced Neural Network Applications참고 문헌 42인용 수 7
한 줄 요약

이 논문은 강력한 데이터 증강과 새로운 분포별 배치 정규화(DSBN)를 활용하여 증강으로 인한 분포 이탈로 인한 훈련의 안정성을 높이는 단순하면서도 효과적인 준지도 학습 세그멘테이션 프레임워크를 제안한다. 또한 노이즈가 있는 가짜 라벨의 영향을 줄이기 위해 자기 보정 손실(self-correction loss)을 도입하여, 라벨이 부족한 경우에도 Cityscapes와 Pascal VOC에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recently, significant progress has been made on semantic segmentation. However, the success of supervised semantic segmentation typically relies on a large amount of labelled data, which is time-consuming and costly to obtain. Inspired by the success of semi-supervised learning methods in image classification, here we propose a simple yet effective semi-supervised learning framework for semantic segmentation. We demonstrate that the devil is in the details: a set of simple design and training techniques can collectively improve the performance of semi-supervised semantic segmentation significantly. Previous works [3, 27] fail to employ strong augmentation in pseudo label learning efficiently, as the large distribution change caused by strong augmentation harms the batch normalisation statistics. We design a new batch normalisation, namely distribution-specific batch normalisation (DSBN) to address this problem and demonstrate the importance of strong augmentation for semantic segmentation. Moreover, we design a self correction loss which is effective in noise resistance. We conduct a series of ablation studies to show the effectiveness of each component. Our method achieves state-of-the-art results in the semi-supervised settings on the Cityscapes and Pascal VOC datasets.

연구 동기 및 목표

  • 세그멘테이션의 픽셀 수준 레이블링 비용을 줄이기 위해 준지도 학습을 통해 레이블이 없는 데이터를 활용하는 것.
  • 강력한 데이터 증강으로 인해 훈련 중 배치 정규화 통계에 발생하는 불안정성을 해결하는 것.
  • 자기 훈련에서 교사 모델이 생성한 노이즈가 많은 가짜 레이블의 부정적 영향을 줄이는 것.
  • 복잡한 아키텍처나 서브넷 없이 준지도 세그멘테이션에서 최신 기술 수준의 성능를 달성하는 것.

제안 방법

  • 훈련 중 약한 증강과 강한 증강 입력에 대해 별도의 배치 통계를 유지하는 분포별 배치 정규화(DSBN)를 제안한다.
  • 일반화 성능 향상을 위해 레이블이 없는 데이터에 강력한 데이터 증강(예: CutMix, MixUp)을 적용하고, DSBN을 통해 배치 정규화 통계의 안정성을 확보한다.
  • 노이즈가 있는 예측을 억제하기 위해 픽셀 단위로 손실 가중치와 학습 타겟을 동적으로 조정하는 자기 보정 손실(SCL)을 도입한다.
  • 교사가 증강된 레이블이 없는 데이터에 대해 가짜 레이블을 생성하고, 학생이 레이블이 있는 데이터와 가짜 레이블이 있는 데이터에서 학습하는 표준 학생-교사 자기 훈련 파이프라인을 활용한다.
  • 모델 업데이트를 반복하여 예측을 개선하고, 여러 라운드에 걸쳐 성능을 향상시키는 반복 훈련을 수행한다.
  • 훈련 분포와 일관성을 유지하기 위해 약한 증강 데이터에서 계산된 배치 통계를 사용하여 추론을 수행한다.

실험 결과

연구 질문

  • RQ1강력한 데이터 증강이 훈련 파이프라인에 적절히 통합될 경우, 준지도 세그멘테이션 성능을 크게 향상시킬 수 있는가?
  • RQ2강력한 증강으로 인해 미니배치 내에서 분포가 크게 이격될 경우, 배치 정규화 통계를 어떻게 안정화할 수 있는가?
  • RQ3자기 보정 손실은 자기 훈련에서 생성된 노이즈가 많은 가짜 레이블의 영향을 어느 정도 줄일 수 있는가?
  • RQ4강력한 증강과 DSBN을 활용한 단순한 프레임워크가 더 복잡한 아키텍처보다 준지도 세그멘테이션에서 더 나은 성능을 내는가?

주요 결과

  • Cityscapes에서 1/8의 레이블 데이터를 사용할 경우, DeepLabV2를 사용해 70.1% mIoU를 달성하고, DeepLabV3Plus를 사용해 78.7% mIoU를 기록하여 이전 최고 기술 수준의 성능를 초월한다.
  • Pascal VOC에서 1/8의 레이블 데이터를 사용할 경우, ResNet-101을 사용해 75.0% mIoU를 기록하고, Xception-65를 사용해 79.3% mIoU를 달성하여 Xception-65 기반 완전 지도 학습의 성능을 재현한다.
  • 절단 실험을 통해 DSBN과 자기 보정 손실이 핵심 요소임을 확인하였으며, DSBN만으로도 기준 모델 대비 mIoU가 2.9% 향상된다.
  • 반복 훈련은 성능 향상을 이끌어내지만, 몇 차례 반복 후에는 성능 향상 폭이 감소하여 수렴하는 경향을 보인다.
  • 다중 서브넷 등의 아키텍처 수정 없이도 최신 기술 수준의 결과를 달성하여, 단순하고 원칙적인 설계 선택의 효과성을 입증한다.
  • 레이블 노이즈에 대해 강건하고 다양한 데이터셋 간 일반화 성능이 뛰어나, DSBN과 SCL의 실세계 준지도 환경에서의 효과성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.