Skip to main content
QUICK REVIEW

[논문 리뷰] Pixel Level Data Augmentation for Semantic Image Segmentation using Generative Adversarial Networks

Shuangting Liu, Jiaqi Zhang|arXiv (Cornell University)|2018. 11. 01.
Advanced Neural Network Applications참고 문헌 20인용 수 7
한 줄 요약

이 논문은 클래스 분포를 보정하고 분할 정확도를 향상시키기 위해 합성된 의미적 레이블 맵에서 현실적인 이미지를 생성하는 GAN 기반 픽셀 수준의 데이터 증강 방법을 제안한다. 레이블 맵에서 사진처럼 사실적인 이미지로의 변환을 학습하기 위해 Pix2PixHD GAN을 훈련시킴으로써, 평균 IoU는 최대 2.1% 향상되고, 자원이 부족한 클래스의 정확도는 최대 5.5% 향상되어 기존의 전통적 및 스타일 전이 기반 증강 방법을 능가한다.

ABSTRACT

Semantic segmentation is one of the basic topics in computer vision, it aims to assign semantic labels to every pixel of an image. Unbalanced semantic label distribution could have a negative influence on segmentation accuracy. In this paper, we investigate using data augmentation approach to balance the semantic label distribution in order to improve segmentation performance. We propose using generative adversarial networks (GANs) to generate realistic images for improving the performance of semantic segmentation networks. Experimental results show that the proposed method can not only improve segmentation performance on those classes with low accuracy, but also obtain 1.3% to 2.1% increase in average segmentation accuracy. It shows that this augmentation method can boost accuracy and be easily applicable to any other segmentation models.

연구 동기 및 목표

  • 의미적 분할 데이터셋에서 불균형한 의미적 레이블 분포 문제를 해결함으로써 희귀 클래스에 대한 모델 성능 저하를 완화하는 것.
  • 깊이 학습 기반 생성 모델을 통해 다양하고 현실적인 훈련 샘플을 생성함으로써, 특히 부족한 클래스에 대해 분할 정확도를 향상시키는 것.
  • 기존의 의미적 분할 모델과 호환되는 확장 가능하고 즉시 사용 가능한 데이터 증강 파이프라인을 개발하는 것.
  • 다양한 증강 전략(단일 레이블, 다중 레이블, 재구성)과 보조 데이터 비율이 분할 성능에 미치는 영향을 조사하는 것.

제안 방법

  • 실제 이미지와 해당 의미적 레이블 맵의 쌍을 기반으로 Pix2PixHD 조건부 GAN을 훈련시어, 레이블 맵에서 사진처럼 사실적인 이미지로의 변환을 학습한다.
  • 생성자 네트워크는 의미적 레이블 맵을 입력으로 받아 현실적인 이미지를 생성하고, 구분자 네트워크는 최소화 손실 목표를 사용하여 실제 이미지와 GAN에 의해 생성된 이미지를 구분한다.
  • 새로운 훈련 데이터는 레이블 맵 재구성 방법을 통해 합성된다: 기본 레이블 맵(예: 하늘, 도로, 건물)을 생성한 후, 추가적인 의미적 클래스(예: 벽, 울타리, 기둥)를 겹쳐 놓는다.
  • 이러한 재구성된 레이블 맵에서 훈련된 GAN을 통해 보조 이미지를 생성함으로써 데이터 다양성을 증가시키고 클래스 표현의 균형을 맞춘다.
  • 최종 훈련 세트는 원본 이미지와 GAN에 의해 생성된 보조 이미지를 다양한 비율(30–70%)로 조합하여 일반화 및 강인성을 평가한다.
  • 분할 모델은 증강된 데이터셋으로 미세 조정되며, 평균 교차율(Intersection over Union, mIoU)을 사용하여 성능을 평가한다.

실험 결과

연구 질문

  • RQ1GAN 기반 픽셀 수준의 데이터 증강이 희귀 의미적 클래스에 대한 분할 정확도 향상에 효과적으로 기여하는가?
  • RQ2증강 전략의 선택(단일 레이블 오버랩, 다중 레이블 오버랩, 레이블 맵 재구성)이 분할 성능에 어떤 영향을 미치는가?
  • RQ3분할 정확도를 최대화하기 위해 보조 데이터와 원본 데이터의 최적 비율은 얼마인가?
  • RQ4GAN에 의해 생성된 데이터는 전통적인 데이터 증강 기법에 비해 클래스별 및 총합 평균 IoU를 향상시키는가?

주요 결과

  • 제안된 재구성 기반 증강 방법이 가장 높은 평균 IoU 79.41%를 기록하여 기준 모델 대비 2.1% 향상되었다.
  • 기존 레이블 맵에 하나의 클래스(예: 벽)를 추가하면 평균 IoU는 1.3% 향상되고, 추가된 클래스의 IoU는 5.0% 향상되었다.
  • 여러 클래스(벽, 울타리, 기둥, 신호등, 기차)를 추가하면 평균 IoU는 1.5% 향상되고, 특정 클래스의 정확도는 최대 5.5% 향상되었다.
  • 훈련에 가장 적합한 보조 데이터 비율은 30%에서 70% 사이였으며, 이를 초과하면 과적합 또는 분포 이탈로 인해 성능이 저하되었다.
  • GAN 기반 방법은 전통적 증강(예: 회전, 확대) 및 최신 스타일 전이 기반 증강보다 뛰어나 평균 IoU 2.1% 향상되었다.
  • 재구성 기반 증강이 가장 우수한 성능을 냈는데, 이는 증강된 훈련 세트의 의미적 레이블 분포에서 더 높은 다양성과 더 나은 균형을 확보했기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.