[논문 리뷰] Learning Semantic Segmentation with Diverse Supervision
이 논문은 다양한 감독 유형—이미지 수준, 박스 수준, 픽셀 수준의 애너테이션—을 동시에 사용하여 CNN 기반의 의미적 세그멘테이션 모델을 훈련하는 유연하고 엔드 투 엔드의 딥 러닝 프레임워크를 제안한다. 각 감독 유형에 대응하는 세 가지 전용 손실 함수를 도입함으로써, 픽셀 수준의 애너테이션이 제한된 경우에도 분할 성능을 크게 향상시켜 PASCAL VOC 2012 및 SIFT-Flow 벤치마크에서 기존의 약한 감독 방법들을 능가한다.
Models based on deep convolutional neural networks (CNN) have significantly improved the performance of semantic segmentation. However, learning these models requires a large amount of training images with pixel-level labels, which are very costly and time-consuming to collect. In this paper, we propose a method for learning CNN-based semantic segmentation models from images with several types of annotations that are available for various computer vision tasks, including image-level labels for classification, box-level labels for object detection and pixel-level labels for semantic segmentation. The proposed method is flexible and can be used together with any existing CNN-based semantic segmentation networks. Experimental evaluation on the challenging PASCAL VOC 2012 and SIFT-flow benchmarks demonstrate that the proposed method can effectively make use of diverse training data to improve the performance of the learned models.
연구 동기 및 목표
- 의미적 세그멘테이션에서 픽셀 수준 애너테이션의 높은 비용과 부족함을 해결하기 위해 더 쉽게 확보할 수 있는 약한 감독 신호를 활용하고자 한다.
- 이미지 수준, 박스 수준, 픽셀 수준의 다수의 감독 유형을 하나의 세그멘테이션 모델에 통합하는 통합적이고 엔드 투 엔드의 훈련 프레임워크를 개발하고자 한다.
- 모든 훈련 데이터에 대해 완전한 픽셀 수준 애너테이션을 요구하지 않고도 CNN 기반의 의미적 세그멘테이션 모델의 성능을 향상시키고자 한다.
- 감독 메커니즘과 베이스라인 네트워크를 분리함으로써 기존의 어떤 CNN 기반 세그멘테이션 아키텍처와도 호환 가능하도록 하고자 한다.
제안 방법
- 이 방법은 세 가지 서로 다른 손실 함수를 사용하는 다중 작업 학습 프레임워크를 활용한다: 이미지 수준 레이블용, 박스 수준 레이블용, 픽셀 수준 레이블용.
- 박스 수준 감독을 위해, 외부 세그멘테이션 도구에 의존하지 않고 다중 스케일 강도에서 학습된 임계값 전략을 사용해 의사 픽셀 수준 마스크를 생성한다.
- 박스 수준 손실 함수(식 3)는 네트워크에서의 신뢰도 점수에 기반해 겹치는 영역을 가중치 처리함으로써 겹치는 박스에서의 레이블 모호성을 해결한다.
- FCN나 확장 네트워크와 같은 기존의 어떤 CNN 기반 세그멘테이션 아키텍처와도 호환되며, 모든 감독 유형을 함께 엔드 투 엔드로 훈련시킴으로써 세그멘테이션 헤드를 훈련시킨다.
- 이미지 수준 감독을 위해 소프트 레이블링 전략을 사용하여 정확한 국소화가 필요 없이 클래스별 활성화 패tern을 학습할 수 있도록 한다.
- 제한된 픽셀 수준 데이터와 풍부한 이미지 및 박스 수준 레이블을 결합함으로써 준지도 학습을 가능하게 하여 일반화 능력과 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1단일 딥 러닝 프레임워크가 이미지 수준, 박스 수준, 픽셀 수준의 애너테이션을 효과적으로 통합하여 의미적 세그멘테이션 성능을 향상시킬 수 있는가?
- RQ2다양한 감독 유형을 통합하는 것이 오직 픽셀 수준 또는 약한 감독 데이터를 사용하는 것과 비교해 어떻게 다른가?
- RQ3박스 수준 애너테이션에서 의사 픽셀 수준 마스크를 생성하기 위한 최적의 전략은 무엇인가? 오류와 모호성을 최소화하는 데 기여하는가?
- RQ4제안된 방법이 고비용의 픽셀 수준 애너테이션에 대한 의존도를 얼마나 줄일 수 있으며, 높은 세그멘테이션 정확도를 유지할 수 있는가?
- RQ5마스크 생성 시 다중 스케일 임계값을 사용할 경우 최종 세그멘테이션 성능에 어떤 영향을 미치는가?
주요 결과
- 제안된 방법은 준지도 학습 조건에서 PASCAL VOC 2012 테스트 세트에서 평균 교차율(mIoU) 61.42를 달성하여 기존의 약한 감독 방법들을 능가한다.
- 오직 1.4k개의 픽셀 수준 애너테이션과 9k개의 박스 수준 애너테이션만을 사용하여도, 완전히 지도된 베이스라인 성능의 98.75%에 도달하여 높은 데이터 효율성을 보여준다.
- 제안된 박스 수준 감독 손실 함수를 사용함으로써, 모델은 검증 세트에서 57.51 mIoU를 달성하여 GrabCut, MCG, 하드 세그멘테이션과 같은 대안 전략보다 1.0~1.9점 높은 성능을 기록한다.
- 제거 분석 결과, 단일 임계값보다 세 가지 강도의 임계값을 사용할 경우 더 나은 성능을 내며, mIoU에서 1.0~1.5점의 향상을 얻는다.
- FCN과 같은 표준 아키텍처와의 조합에서 강력한 호환성과 성능 향상을 보이며, 다양한 벤치마크에서 일관된 향상을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.