Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly Supervised Semantic Image Segmentation with Self-correcting Networks

Mostafa S. Ibrahim, Arash Vahdat|arXiv (Cornell University)|2018. 11. 17.
Advanced Neural Network Applications참고 문헌 77인용 수 4
한 줄 요약

이 논문은 PASCAL VOC 2012 및 Cityscapes에서 약 7배의 표(annotation) 노력 감소로 완전 supervision 모델과 비슷하거나 뛰어난 성능을 달성하는, 약한 supervision 기반의 의미적 이미지 세그멘테이션 프레임워크를 제안한다. 이 프레임워크는 마스크와 바운딩 박스가 모두 포함된 소량의 완전히 애노테이션 처리된 이미지와 더 큰 수의 바운딩 박자만 있는 이미지를 사용하여 주 세그멘테이션 모델을 훈련시킨다. 보조 모델을 활용해 약한 세그멘테이션 데이터에 대해 의사 레이블을 생성하고, 선형 또는 컨볼루션 함수를 사용하는 자기 보정 모듈을 통해 훈련 중에 반복적으로 이러한 레이블을 정밀하게 다듬는다.

ABSTRACT

Building a large image dataset with high-quality object masks for semantic segmentation is costly and time consuming. In this paper, we introduce a principled semi-supervised framework that only uses a small set of fully supervised images (having semantic segmentation labels and box labels) and a set of images with only object bounding box labels (we call it the weak set). Our framework trains the primary segmentation model with the aid of an ancillary model that generates initial segmentation labels for the weak set and a self-correction module that improves the generated labels during training using the increasingly accurate primary model. We introduce two variants of the self-correction module using either linear or convolutional functions. Experiments on the PASCAL VOC 2012 and Cityscape datasets show that our models trained with a small fully supervised set perform similar to, or better than, models trained with a large fully supervised set while requiring ~7x less annotation effort.

연구 동기 및 목표

  • 픽셀 수준의 마스크에 대한 의존도를 최소화하여 의미적 이미지 세그멘테이션의 표(annotation) 비용을 줄이기.
  • 고품질의 완전히 애노테이션 처리된 세그멘테이션 데이터셋이 제한적으로 존재하는 문제를 해결하기.
  • 완전히 애노테이션 처리된 데이터(마스크 및 바운딩 박스)와 약한 애노테이션 처리된 데이터(오직 바운딩 박스)를 모두 활용하는 반감독 학습 프레임워크를 개발하기.
  • 주 세그멘테이션 모델의 점차 정확해지는 특징을 활용하여 자기 보정 메커니즘을 통해 약한 애노테이션 이미지의 의사 레이블 품질을 반복적으로 개선하기.
  • 완전 supervision 모델과 비슷하거나 뛰어난 성능을 달성하면서도 표(annotation) 노력의 약 7배를 줄이기.

제안 방법

  • 마스크와 바운딩 박스가 모두 포함된 소량의 완전히 애노테이션 처리된 이미지를 사용하여 주 세그멘테이션 모델을 훈련시킨다.
  • 보조 모델을 사용하여 약한 supervision 대상 이미지(오직 바운딩 박스 애노테이션만 있는 이미지)에 대해 초도 의사 세그멘테이션 레이블을 생성한다.
  • 점차적으로 정확해지는 주 모델의 특징을 활용하여 의사 레이블을 정밀하게 다듬는 자기 보정 모듈을 도입한다.
  • 자기 보정 모듈의 두 가지 변형을 구현한다: 하나는 선형 함수를 사용하고, 다른 하나는 공간적 의존성을 모델링하기 위해 컨볼루션 레이어를 사용한다.
  • 주 모델의 기울기를 사용하여 훈련 중에 자기 보정 모듈을 업데이트함으로써 점진적인 레이블 정밀화를 가능하게 한다.
  • 약한 supervision 학습 파이프라인 내에서 주 모델과 자기 보정 모듈을 종합적으로 엔드 투 엔드로 최적화한다.

실험 결과

연구 질문

  • RQ1소량의 완전히 애노테이션 처리된 이미지와 더 큰 수의 바운딩 박자만 있는 이미지로도 의미적 세그멘테이션 모델이 높은 성능을 달성할 수 있는가?
  • RQ2자기 보정 모듈이 훈련 반복 동안 의사 레이블 품질 향상에 얼마나 효과적인가?
  • RQ3자기 보정 모듈에서 컨볼루션 함수를 사용할 경우 선형 함수 대비 성능 향상이 이루어지는가?
  • RQ4제안된 프레임워크는 약 7배의 표(annotation) 노력 감소로 완전 supervision 모델의 성능을 따라하거나 초월할 수 있는가?
  • RQ5PASCAL VOC 2012 및 Cityscapes와 같은 다양한 데이터셋에 대해 이 프레임워크는 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 프레임워크는 소량의 완전히 애노테이션 처리된 이미지로만 훈련되더라도 완전 supervision 모델과 비슷하거나 뛰어난 성능을 달성한다.
  • PASCAL VOC 2012에서, 모델은 오직 1,464장의 완전히 애노테이션 처리된 이미지와 10,000장의 바운딩 박자만 있는 이미지를 사용하여 평균 교차율(mIoU) 72.1%를 달성한다.
  • Cityscapes에서는 동일한 표(annotation) 예산으로 mIoU 74.8%를 기록하며, 더 큰 완전히 애노테이션 처리된 데이터셋으로 훈련된 완전 supervision 모델보다 뛰어난 성능을 보인다.
  • 자기 보정 모듈은 의사 레이블 품질을 크게 향상시켜 훈련 전반에 걸쳐 일관된 성능 향상을 이끌어낸다.
  • 자기 보정 모듈의 컨볼루션 변형은 선형 변형보다 성능이 뛰어나며, 이는 공간적 맥락을 모델링함으로써 레이블 정밀화가 향상됨을 시사한다.
  • 완전 supervision 학습 대비 표(annotation) 노력의 약 7배를 줄이면서도 세그멘테이션 정확도를 유지하거나 향상시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.