Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Semantic Segmentation with Diverse Supervision

Linwei Ye, Zhi Liu|arXiv (Cornell University)|2018. 02. 01.
Advanced Neural Network Applications참고 문헌 22인용 수 5
한 줄 요약

이 논문은 다양한 감독 유형—이미지 수준, 박스 수준, 픽셀 수준의 애너테이션—을 동시에 사용하여 CNN 기반의 의미적 세그멘테이션 모델을 훈련하는 유연하고 엔드 투 엔드의 딥 러닝 프레임워크를 제안한다. 각 감독 유형에 대응하는 세 가지 전용 손실 함수를 도입함으로써, 픽셀 수준의 애너테이션이 제한된 경우에도 분할 성능을 크게 향상시켜 PASCAL VOC 2012 및 SIFT-Flow 벤치마크에서 기존의 약한 감독 방법들을 능가한다.

ABSTRACT

Models based on deep convolutional neural networks (CNN) have significantly improved the performance of semantic segmentation. However, learning these models requires a large amount of training images with pixel-level labels, which are very costly and time-consuming to collect. In this paper, we propose a method for learning CNN-based semantic segmentation models from images with several types of annotations that are available for various computer vision tasks, including image-level labels for classification, box-level labels for object detection and pixel-level labels for semantic segmentation. The proposed method is flexible and can be used together with any existing CNN-based semantic segmentation networks. Experimental evaluation on the challenging PASCAL VOC 2012 and SIFT-flow benchmarks demonstrate that the proposed method can effectively make use of diverse training data to improve the performance of the learned models.

연구 동기 및 목표

  • 의미적 세그멘테이션에서 픽셀 수준 애너테이션의 높은 비용과 부족함을 해결하기 위해 더 쉽게 확보할 수 있는 약한 감독 신호를 활용하고자 한다.
  • 이미지 수준, 박스 수준, 픽셀 수준의 다수의 감독 유형을 하나의 세그멘테이션 모델에 통합하는 통합적이고 엔드 투 엔드의 훈련 프레임워크를 개발하고자 한다.
  • 모든 훈련 데이터에 대해 완전한 픽셀 수준 애너테이션을 요구하지 않고도 CNN 기반의 의미적 세그멘테이션 모델의 성능을 향상시키고자 한다.
  • 감독 메커니즘과 베이스라인 네트워크를 분리함으로써 기존의 어떤 CNN 기반 세그멘테이션 아키텍처와도 호환 가능하도록 하고자 한다.

제안 방법

  • 이 방법은 세 가지 서로 다른 손실 함수를 사용하는 다중 작업 학습 프레임워크를 활용한다: 이미지 수준 레이블용, 박스 수준 레이블용, 픽셀 수준 레이블용.
  • 박스 수준 감독을 위해, 외부 세그멘테이션 도구에 의존하지 않고 다중 스케일 강도에서 학습된 임계값 전략을 사용해 의사 픽셀 수준 마스크를 생성한다.
  • 박스 수준 손실 함수(식 3)는 네트워크에서의 신뢰도 점수에 기반해 겹치는 영역을 가중치 처리함으로써 겹치는 박스에서의 레이블 모호성을 해결한다.
  • FCN나 확장 네트워크와 같은 기존의 어떤 CNN 기반 세그멘테이션 아키텍처와도 호환되며, 모든 감독 유형을 함께 엔드 투 엔드로 훈련시킴으로써 세그멘테이션 헤드를 훈련시킨다.
  • 이미지 수준 감독을 위해 소프트 레이블링 전략을 사용하여 정확한 국소화가 필요 없이 클래스별 활성화 패tern을 학습할 수 있도록 한다.
  • 제한된 픽셀 수준 데이터와 풍부한 이미지 및 박스 수준 레이블을 결합함으로써 준지도 학습을 가능하게 하여 일반화 능력과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1단일 딥 러닝 프레임워크가 이미지 수준, 박스 수준, 픽셀 수준의 애너테이션을 효과적으로 통합하여 의미적 세그멘테이션 성능을 향상시킬 수 있는가?
  • RQ2다양한 감독 유형을 통합하는 것이 오직 픽셀 수준 또는 약한 감독 데이터를 사용하는 것과 비교해 어떻게 다른가?
  • RQ3박스 수준 애너테이션에서 의사 픽셀 수준 마스크를 생성하기 위한 최적의 전략은 무엇인가? 오류와 모호성을 최소화하는 데 기여하는가?
  • RQ4제안된 방법이 고비용의 픽셀 수준 애너테이션에 대한 의존도를 얼마나 줄일 수 있으며, 높은 세그멘테이션 정확도를 유지할 수 있는가?
  • RQ5마스크 생성 시 다중 스케일 임계값을 사용할 경우 최종 세그멘테이션 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 준지도 학습 조건에서 PASCAL VOC 2012 테스트 세트에서 평균 교차율(mIoU) 61.42를 달성하여 기존의 약한 감독 방법들을 능가한다.
  • 오직 1.4k개의 픽셀 수준 애너테이션과 9k개의 박스 수준 애너테이션만을 사용하여도, 완전히 지도된 베이스라인 성능의 98.75%에 도달하여 높은 데이터 효율성을 보여준다.
  • 제안된 박스 수준 감독 손실 함수를 사용함으로써, 모델은 검증 세트에서 57.51 mIoU를 달성하여 GrabCut, MCG, 하드 세그멘테이션과 같은 대안 전략보다 1.0~1.9점 높은 성능을 기록한다.
  • 제거 분석 결과, 단일 임계값보다 세 가지 강도의 임계값을 사용할 경우 더 나은 성능을 내며, mIoU에서 1.0~1.5점의 향상을 얻는다.
  • FCN과 같은 표준 아키텍처와의 조합에서 강력한 호환성과 성능 향상을 보이며, 다양한 벤치마크에서 일관된 향상을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.