Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised Scale Equivariant Network for Weakly Supervised Semantic Segmentation

Yude Wang, Jie Zhang|arXiv (Cornell University)|2019. 09. 09.
Advanced Neural Network Applications참고 문헌 28인용 수 22
한 줄 요약

이 논문은 이미지 수준 레이블만을 사용하여 PASCAL VOC 2012에서 최고 성능을 달성하기 위해, 클래스 활성화 맵(CAMs)에 스케일 불변성을 강제하는 새로운 정규화 손실을 통해 자기지도 학습 기반 스케일 불변 네트워크(SSENet)를 제안한다. 서로 다른 이미지 스케일 간에 일관된 CAMs를 확보함으로써, 과도한 활성화 및 부족한 활성화 문제를 줄이며, 약한 지도 학습 기반 세분화 성능을 향상시킨다.

ABSTRACT

Weakly supervised semantic segmentation has attracted much research interest in recent years considering its advantage of low labeling cost. Most of the advanced algorithms follow the design principle that expands and constrains the seed regions from class activation maps (CAM). As well-known, conventional CAM tends to be incomplete or over-activated due to weak supervision. Fortunately, we find that semantic segmentation has a characteristic of spatial transformation equivariance, which can form a few self-supervisions to help weakly supervised learning. This work mainly explores the advantages of scale equivariant constrains for CAM generation, formulated as a self-supervised scale equivariant network (SSENet). Specifically, a novel scale equivariant regularization is elaborately designed to ensure consistency of CAMs from the same input image with different resolutions. This novel scale equivariant regularization can guide the whole network to learn more accurate class activation. This regularized CAM can be embedded in most recent advanced weakly supervised semantic segmentation framework. Extensive experiments on PASCAL VOC 2012 datasets demonstrate that our method achieves the state-of-the-art performance both quantitatively and qualitatively for weakly supervised semantic segmentation. Code has been made available.

연구 동기 및 목표

  • 다른 이미지 스케일 간에 클래스 활성화 맵(CAMs)의 일관성 부족으로 인해 약한 지도 학습 기반 세분화 성능이 떨어지는 문제를 해결하기 위해.
  • 추가 애너테이션을 필요로 하지 않고 CAM 품질을 향상시키기 위해 자기지도 학습을 탐색하기 위해.
  • CAMs에 스케일 불변성을 강제하는 정규화 방법을 개발하여 스케일 변형된 입력에 대해 일관된 활성화 패턴을 확보하기 위해.
  • 기존의 약한 지도 학습 세분화 프레임워크에 제안된 방법을 통합하여 성능 향상을 이루기 위해.
  • 이미지 수준 지도만을 사용하여 PASCAL VOC 2012에서 최고 성능을 달성하기 위해.

제안 방법

  • 동일한 이미지를 다중 스케일에서 처리하는 두 가지 브런치로 구성된 네트워크 아키텍처를 제안하여 스케일 불변성을 강제한다.
  • 입력 이미지의 다양한 해상도에서의 CAMs 간 차이를 최소화하는 스케일 불변 정규화(SER) 손실을 도입한다.
  • 입력 이미지에 공간 변환(예: 크기 조정)을 적용하고, 역워핑을 사용하여 CAMs를 정렬하여 지도 신호로 활용한다.
  • 정규화된 CAMs를 표준 약한 지도 학습 기반 세분화 파ipeline에서 의사 세분화 레이블로 사용한다.
  • ResNet-38 백본을 사용하는 AffinityNet 및 DeepLab과 같은 최신 프레임워크에 방법을 통합한다.
  • 추가 애너테이션에 의존하지 않고 스케일 일관성을 감독 신호로 활용하는 자기지도 학습 프레임워크를 적용한다.

실험 결과

연구 질문

  • RQ1클래스 활성화 맵(CAMs)에 스케일 불변성을 강제하면, 약한 지도 학습 기반 세분화에서 의사 세분화 레이블의 품질이 향상되는가?
  • RQ2스케일 불변 정규화는 서로 다른 이미지 스케일 간에 CAMs의 과도한 활성화 및 부족한 활성화를 어떻게 줄이는가?
  • RQ3자기지도 학습 기반 스케일 일관성은 이미지 수준 약한 지도 학습에 효과적인 인덕티브 바이어스가 될 수 있는가?
  • RQ4강력한 지도 학습보다 더 강력한 지도 신호를 사용하는 기존 최고 성능 방법들과 비교해 볼 때, 제안된 방법은 세분화 성능을 얼마나 향상시키는가?
  • RQ5이 방법은 다양한 백본 아키텍처와 세분화 프레임워크에 일반화되는가?

주요 결과

  • SSENet은 PASCAL VOC 2012 테스트 세트에서 평균 교차율(mIoU) 64.9%를 기록하여 기준 모델인 AffinityNet 및 기타 최고 성능 방법들을 능가한다.
  • 특히 큰 객체에서 더 나은 CAM 일관성 덕분에, 다양한 스케일 간에 잘못된 양성 영역(m_FP)을 줄이고 참 양성 영역 커버리지(m_FN)를 향상시킨다.
  • 정량적 분석을 통해 스케일 불변 정규화가 작은 객체의 과도한 활성화와 큰 객체의 부족한 활성화를 크게 줄임을 확인하였다.
  • 경계 상자, 스케치, 점 등의 더 강력한 지도 신호를 사용하는 방법들과 비교해도, 이미지 수준 레이블만을 사용함에도 불구하고 경쟁 가능한 성능을 달성하였다.
  • 제거 실험을 통해 SER 손실이 성능 향상의 주요 원동력임을 확인하였으며, 개선된 CAMs가 세분화 학습에 더 나은 의사 레이블을 제공함을 입증하였다.
  • 이 방법은 쉽게 통합 가능하며, 아키텍처 변경 없이도 기존의 약한 지도 학습 기반 프레임워크를 향상시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.