Skip to main content
QUICK REVIEW

[논문 리뷰] Mask-based Data Augmentation for Semi-supervised Semantic Segmentation

Ying Chen, Xu Ouyang|arXiv (Cornell University)|2021. 01. 25.
Advanced Neural Network Applications참고 문헌 9인용 수 6
한 줄 요약

이 논문은 레이블이 없는 데이터에서 복잡하고 의미적으로 올바른 증강 샘플을 생성함으로써, 제한된 레이블 데이터로도 성능을 향상시키는 새로운 마스크 기반 데이터 증강 방법인 ComplexMix를 제안한다. 분할 맵을 정사각형으로 나누고, 각 영역에 대해 클래스 레이블을 예측한 후, 선택된 클래스를 마스크를 사용해 붙여넣음으로써 증강의 복잡성과 의미적 정확성을 균형 잡는다. 이 방법은 레이블이 적은 조건에서도 Cityscapes 데이터셋에서 최신 기준 mIoU를 달성한다.

ABSTRACT

Semantic segmentation using convolutional neural networks (CNN) is a crucial component in image analysis. Training a CNN to perform semantic segmentation requires a large amount of labeled data, where the production of such labeled data is both costly and labor intensive. Semi-supervised learning algorithms address this issue by utilizing unlabeled data and so reduce the amount of labeled data needed for training. In particular, data augmentation techniques such as CutMix and ClassMix generate additional training data from existing labeled data. In this paper we propose a new approach for data augmentation, termed ComplexMix, which incorporates aspects of CutMix and ClassMix with improved performance. The proposed approach has the ability to control the complexity of the augmented data while attempting to be semantically-correct and address the tradeoff between complexity and correctness. The proposed ComplexMix approach is evaluated on a standard dataset for semantic segmentation and compared to other state-of-the-art techniques. Experimental results show that our method yields improvement over state-of-the-art methods on standard datasets for semantic image segmentation.

연구 동기 및 목표

  • 정확한 의미 분할를 위한 대규모 레이블 데이터셋 확보의 높은 비용과 노동 집약성을 해결하기 위해.
  • 고도화된 데이터 증강을 통해 레이블이 없는 데이터를 효과적으로 활용함으로써 반감독 학습 성능을 향상시키기 위해.
  • 생성된 훈련 샘플에서 증강의 복잡성과 의미적 정확성 간의 상충 관계를 균형 잡기 위해.
  • 의미 분할에서 일致성 정규화를 향상시키는 데이터 증강 전략을 개발하기 위해.

제안 방법

  • 비라벨 이미지의 분할 맵을 동일한 크기의 정사각형으로 나누어 증강을 위한 영역을 국소화한다.
  • 각 정사각형에 대해 모델이 의미 클래스 레이블을 예측하고, 예측된 클래스의 절반을 선택하여 혼합한다.
  • 선택된 클래스를 기반으로 마스크를 생성하여 혼합된 이미지에 붙여넣으며, 의미 경계를 유지한다.
  • 학생 모델이 혼합된 이미지에서 교사 모델의 예측과 일치하도록 훈련하는 평균 교사 프레임워크를 사용한다.
  • 손실 함수로는 레이블이 있는 데이터에 대한 지도형 교차 엔트로피와, 가짜 레이블이 부여된 혼합된 비라벨 샘플에 대한 비지도형 교차 엔트로피를 포함한다.
  • 교사 모델은 학생 모델 가중치의 지수 이동 평균을 통해 업데이트되어 일致성 정규화가 향상된다.

실험 결과

연구 질문

  • RQ1복잡성을 제어하면서도 의미적 정확성을 유지하는 데이터 증강 전략이 반감독 의미 분할을 향상시킬 수 있는가?
  • RQ2영역별 클래스 예측을 기반으로 한 마스크 기반 증강이 무작위 또는 단순한 경계 인식 혼합보다 어떻게 다른가?
  • RQ3낮은 레이블 비율 조건에서 기존 최신 기준 방법보다 ComplexMix가 승리하는가?
  • RQ4증강의 복잡성 제어가 모델 일반화와 예측 일관성 간의 상충 관계에 얼마나 영향을 미치는가?

주요 결과

  • ComplexMix는 Cityscapes 데이터셋에서 반감독 의미 분할 분야에서 최신 기준 성능을 달성한다.
  • 테스트된 모든 레이블 데이터 비율에서 mIoU가 향상되며, 특히 저도수 감독 조건에서 기준 방법보다 일관된 성능 향상을 보였다.
  • 영역별 클래스 예측과 선택적 클래스 붙여넣기를 통해 무작위 또는 균일한 혼합보다 더 의미적으로 일관된 증강 샘플을 생성한다.
  • 제거 분석 결과, 초기 분할 시 정사각형 수 제어가 복잡성과 정확성 간의 균형을 효과적으로 맞추며 모델의 강건성을 향상시킨다.
  • 평균 교사 프레임워크와 ComplexMix의 조합은 안정적이고 일관된 성능 향상을 보이며, 구조화된 증강과 함께 일치성 정규화의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.