Skip to main content
QUICK REVIEW

[논문 리뷰] Coarse-to-fine Semantic Segmentation from Image-level Labels

Longlong Jing, Yucheng Chen|arXiv (Cornell University)|2018. 12. 28.
Advanced Neural Network Applications참고 문헌 6인용 수 5
한 줄 요약

이 논문은 이미지 수준의 레이블만을 사용하여 반복적으로 보완된 굵은 마스크를 통해 전체 컨volution 네트워크를 재귀적으로 학습하는 약한 지도 학습 세분화 프레임워크를 제안한다. 그래프 모델을 통해 향상된 비지도 전경 마스크에서 시작하여, 단일 이미지 카테고리(이미지넷 스타일)만을 사용함에도 불구하고 PASCAL VOC에서 최신 기술 수준의 성능을 달성하며, 개별 객체에 대한 레이블 없이 다중 카테고리 객체를 처리할 수 있다.

ABSTRACT

Deep neural network-based semantic segmentation generally requires large-scale cost extensive annotations for training to obtain better performance. To avoid pixel-wise segmentation annotations which are needed for most methods, recently some researchers attempted to use object-level labels (e.g. bounding boxes) or image-level labels (e.g. image categories). In this paper, we propose a novel recursive coarse-to-fine semantic segmentation framework based on only image-level category labels. For each image, an initial coarse mask is first generated by a convolutional neural network-based unsupervised foreground segmentation model and then is enhanced by a graph model. The enhanced coarse mask is fed to a fully convolutional neural network to be recursively refined. Unlike existing image-level label-based semantic segmentation methods which require to label all categories for images contain multiple types of objects, our framework only needs one label for each image and can handle images contains multi-category objects. With only trained on ImageNet, our framework achieves comparable performance on PASCAL VOC dataset as other image-level label-based state-of-the-arts of semantic segmentation. Furthermore, our framework can be easily extended to foreground object segmentation task and achieves comparable performance with the state-of-the-art supervised methods on the Internet Object dataset.

연구 동기 및 목표

  • 픽셀 수준의 레이블이 비용이 많이 들기 때문에, 오직 이미지 수준의 카테고리 레이블만을 요구하는 세분화 프레임워크를 개발하는 것.
  • 이미지넷처럼 각 이미지에 단일 카테고리 레이블을 사용하는 데이터셋, 예를 들어 ImageNet에서의 학습을 가능하게 하는 것.
  • 각 이미지에 하나의 레이블만 제공되더라도, 다중 객체 카테고리가 포함된 이미지를 처리할 수 있도록 하는 것.
  • 약한 지도 학습을 사용하여 PASCAL VOC 및 전경 세분화 벤치마크에서 경쟁 가능한 성능을 달성하는 것.

제안 방법

  • 초기 굵은 마스크는 CNN 기반의 비지도 전경 세분화 모델을 사용하여 생성된다.
  • 그래프 모델을 통해 굵은 마스크를 향상시켜 공간 일관성을 높이고 노이즈를 줄인다.
  • 향상된 마스크, 입력 이미지, 이미지 수준의 레이블을 사용하여 전체 컨volution 네트워크(FCN)를 재귀적으로 학습시킨다.
  • 재귀적 보완 과정을 통해 마스크의 품질이 굵은 마스크에서 세밀한 예측으로 점차 향상된다.
  • 학습 중에 경계 상자, 스케치, 다중 레이블 annotation을 요구하지 않고 오직 이미지 수준의 카테고리 레이블만을 활용한다.
  • 이 방법은 전경 객체 세분화로도 확장 가능하며, MIT Object Discovery 데이터셋에서 경쟁 가능한 성능을 달성한다.

실험 결과

연구 질문

  • RQ1간단하고 때로는 정확도가 떨어지는 이미지 수준의 카테고리 레이블만으로도 효과적으로 세분화를 학습할 수 있는가?
  • RQ2이미지넷처럼 단일 카테고리 레이블만 있는 이미지로 학습된 모델이 다중 객체 카테고리가 포함된 이미지로 일반화될 수 있는가?
  • RQ3약한 지도 학습 하에 전체 컨볼루션 네트워크를 사용해 굵은 마스크를 재귀적으로 보완하는 것이 픽셀 수준의 세분화를 달성하는 데 얼마나 효과적인가?
  • RQ4제안된 그래프 기반의 굵은 마스크 보완 방식이 직접 보완 방식보다 최종 세분화 성능을 향상시키는가?

주요 결과

  • 제안된 방법은 PASCAL VOC 2012 데이터셋에서 최신 기술 수준의 이미지 수준 레이블 기반 세분화 방법과 비교해 유사한 성능을 달성한다.
  • 노이즈가 많고 단일 카테고리인 ImageNet 레이블로 학습된 경우에도 대부분의 기존 이미지 수준 레이블 기반 방법보다 성능이 뛰어나다.
  • MIT Object Discovery 데이터셋에서 평균 IoU가 69.9%를 기록하여 인간이 레이블링한 마스크를 사용하는 지도 학습 방법보다 2.06% 떨어지지 않는다.
  • 혼동 행렬을 통해 대부분의 카테고리(예: 새, 양, 기차)에 대해 높은 클래스별 IoU를 보이며, 여러 클래스에서 픽셀 정확도가 80%를 초과한다.
  • 정성적 결과는 단일 레이블만 제공되더라도 하나의 이미지에서 다중 객체 카테고리 간의 구분 능력을 모델이 잘 보여준다.
  • 재귀적 보완 과정을 통해 노이즈가 많고 굵은 마스크가 정확한 픽셀 수준의 세분화 마스크로 성공적으로 변환된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.