Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly-Supervised Semantic Segmentation via Sub-category Exploration

Yu-Ting Chang, Qiaosong Wang|arXiv (Cornell University)|2020. 08. 03.
Advanced Neural Network Applications참고 문헌 42인용 수 11
한 줄 요약

이 논문은 약한 감독(semi-supervised) 세분화 성능을 햖을 위해 초기 클래스 활성화 맵(CAMs)을 향상시키기 위해 자기지도(sub-category) 탐색 방법을 제안한다. 각 부모 카테고리 내에서 이미지 특징을 반복적으로 군집화하고, 하위 카테고리 목표를 학습함으로써 모델은 더 완전한 물체 표현을 학습하게 되어, 향상된 CAMs와 PASCAL VOC 2012에서 CRF 보정을 적용한 상태에서 최신 기준인 66.1%의 mIoU를 달성한다.

ABSTRACT

Existing weakly-supervised semantic segmentation methods using image-level annotations typically rely on initial responses to locate object regions. However, such response maps generated by the classification network usually focus on discriminative object parts, due to the fact that the network does not need the entire object for optimizing the objective function. To enforce the network to pay attention to other parts of an object, we propose a simple yet effective approach that introduces a self-supervised task by exploiting the sub-category information. Specifically, we perform clustering on image features to generate pseudo sub-categories labels within each annotated parent class, and construct a sub-category objective to assign the network to a more challenging task. By iteratively clustering image features, the training process does not limit itself to the most discriminative object parts, hence improving the quality of the response maps. We conduct extensive analysis to validate the proposed method and show that our approach performs favorably against the state-of-the-art approaches.

연구 동기 및 목표

  • 분류 네트워크에서 유도된 정확도가 떨어지는 초기 반응 맵에 의존하는 약한 감독 세분화 방법의 한계를 해결한다.
  • 네트워크가 단지 특징적인 부분이 아닌 전체 물체에 주의를 기울이도록 유도하여 클래스 활성화 맵(CAMs)의 품질을 향상시킨다.
  • 이미지 수준 분류의 최적화 목표로 인해 CAMs가 선명한 물체 부분에만 집중하는 경향을 완화한다.
  • 추가 애너테이션 없이도 특징 표현을 향상시키기 위해 자기지도 하위 카테고리 탐색 작업을 도입한다.
  • 후속 보정 및 세분화 단계에 유리한 초기 예측 단계를 향상시킴으로써 최신 기술 성능을 달성한다.

제안 방법

  • PASCAL VOC 2012 데이터셋의 각 부모 카테고리(예: 'aeroplane', 'car')에 대해 사전에 훈련된 분류 네트워크에서 추출한 특징에 대해 무 supervision 군집화를 수행한다.
  • 결과로 도출된 군집 할당을 가짜 하위 카테고리 레이블로 사용하여 자기지도 방식으로 하위 카테고리 분류 헤드를 훈련한다.
  • 이미지 특징 군집화와 하위 카테고리 목표에 대한 분류 네트워크의 미세조정을 반복적으로 번갈아가며 특징 표현을 향상시킨다.
  • 네트워크의 정규화 및 더 낮은 특징성이나 의미적으로 관련 있는 물체 부분에 주의를 기울이도록 유도하기 위해 하위 카테고리 목표를 훈련 과정에 통합한다.
  • 개선된 네트워크를 사용해 더 나은 초기 반응 맵을 생성하고, 이를 최종 세분화 네트워크 훈련을 위한 가짜 지도 데이터로 사용한다.
  • 최종 세분화 출력을 더욱 정교하게 만들기 위해 CRF 후처리를 적용하여 검증 및 테스트 세트에서 mIoU를 향상시킨다.
Figure 1: Existing weakly-supervised semantic segmentation methods based on image-level supervisions usually apply the class activation map (CAM) to obtain the response map as the initial prediction. However, this response map can only highlight the discriminative parts of the object (top). We propo
Figure 1: Existing weakly-supervised semantic segmentation methods based on image-level supervisions usually apply the class activation map (CAM) to obtain the response map as the initial prediction. However, this response map can only highlight the discriminative parts of the object (top). We propo

실험 결과

연구 질문

  • RQ1무 supervision 군집화를 통한 하위 카테고리 탐색이 약한 감독 세분화에서 초기 클래스 활성화 맵의 품질을 향상시킬 수 있는가?
  • RQ2자기지도 하위 카테고리 목표를 도입함으로써 네트워크가 단지 특징적인 부분이 아닌 전체 물체에 주의를 기울일 수 있는가?
  • RQ3반복적인 군집화와 가짜 레이블 훈련이 추가 감독 없이도 더 나은 특징 표현을 가능하게 하는가?
  • RQ4mIoU와 다양한 카테고리에 대한 강건성 측면에서 제안된 방법은 최신 기술 대비 어떻게 비교되는가?
  • RQ5이 방법은 초기 반응 맵 품질을 어느 정도 향상시키며, 이는 최종 세분화 성능 향상으로 어떻게 이어지는가?

주요 결과

  • 제안된 방법은 CRF 보정을 적용한 PASCAL VOC 2012 테스트 세트에서 66.1%의 mIoU를 달성하여 최신 기술을 초월한다.
  • CRF 보정 없이도 64.8%의 mIoU를 기록하여 FickleNet의 64.9%와 유사한 성능을 보이며, 개선된 초기 반응 맵의 강력한 성능을 입증한다.
  • qualitative 예시를 통해 특징적인 부분에만 집중하는 것에서 벗어나 전체 물체에 주의를 기울이는 방향으로 CAMs가 향상됨을 확인하였다.
  • 절단 실험을 통해 하위 카테고리 군집화와 반복적 훈련 방식이 특징 표현과 세분화 품질을 크게 향상시킴을 확인하였다.
  • 네트워크는 물체 크기, 유형, 맥락 및 공존 패턴을 기반으로 하위 카테고리를 구분함으로써 의미 있는 특징 분리가 이루어짐을 보여주었다.
  • CRF를 사용할 경우 20개 클래스 중 11개에서 유리한 성능을 기록하였으며, 비교 표에서 빨간색, 초록색, 파란색으로 표시된 최고 성능을 기록하였다.
Figure 2: Proposed framework for generating the class activation map. Given input images $I$ , we first feed them into a feature extractor $E$ to obtain their features $f$ . Then, we adopt unsupervised clustering on $f$ and obtain sub-category pseudo labels $Y_{s}$ for each image. Next, we train the
Figure 2: Proposed framework for generating the class activation map. Given input images $I$ , we first feed them into a feature extractor $E$ to obtain their features $f$ . Then, we adopt unsupervised clustering on $f$ and obtain sub-category pseudo labels $Y_{s}$ for each image. Next, we train the

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.