Skip to main content
QUICK REVIEW

[논문 리뷰] Saliency Guided Self-attention Network for Weakly and Semi-supervised Semantic Segmentation

Qi Yao, Xiaojin Gong|arXiv (Cornell University)|2019. 10. 12.
Advanced Neural Network Applications참고 문헌 46인용 수 10
한 줄 요약

이 논문은 약한 감독 및 준감독 세분화를 위한 쌍방향 자극 주도 자기주의 네트워크(SGAN)를 제안한다. 클래스에 관계없는 자극 지도와 클래스별 주의 힌트를 통합하여 자기주의 메커니즘을 안내하고 활성화의 잘못된 확산을 방지한다. 이 방법은 PASCAL VOC 2012 및 COCO에서 최신 기술 수준의 성능을 달성하며, 약한 감독 하에서 64.2%의 mIoU를 기록하고, 부분적인 참조 정보로 사전을 교체함으로써 준감독 설정으로의 강력한 일반화 성능을 보인다.

ABSTRACT

Weakly supervised semantic segmentation (WSSS) using only image-level labels can greatly reduce the annotation cost and therefore has attracted considerable research interest. However, its performance is still inferior to the fully supervised counterparts. To mitigate the performance gap, we propose a saliency guided self-attention network (SGAN) to address the WSSS problem. The introduced self-attention mechanism is able to capture rich and extensive contextual information but may mis-spread attentions to unexpected regions. In order to enable this mechanism to work effectively under weak supervision, we integrate class-agnostic saliency priors into the self-attention mechanism and utilize class-specific attention cues as an additional supervision for SGAN. Our SGAN is able to produce dense and accurate localization cues so that the segmentation performance is boosted. Moreover, by simply replacing the additional supervisions with partially labeled ground-truth, SGAN works effectively for semi-supervised semantic segmentation as well. Experiments on the PASCAL VOC 2012 and COCO datasets show that our approach outperforms all other state-of-the-art methods in both weakly and semi-supervised settings.

연구 동기 및 목표

  • 비싼 픽셀 수준의 참조가 필요한 것에 비해, 완전 감독과 약한 감독 세분화 간의 성능 격차를 줄이기 위해.
  • 약한 감독 하에서 특징적인 부분이 배경 또는 다른 객체 영역으로 잘못 활성화되는 자기주의 메커니즘의 잘못된 확산 문제를 완화하기 위해.
  • 클래스에 관계없는 자극 사전과 클래스별 주의 힌트를 융합하여 시 semantically 정확하고 조밀한 객체 위치 추정을 향상시키기 위해.
  • 자극과 주의 사전을 부분적인 참조 세그먼테이션 마스크로 교체함으로써 동일한 아키텍처가 준감독 학습으로 일반화될 수 있도록 하기 위해.

제안 방법

  • 장거리 맥락적 의존성을 포착하기 위해 약한 감독 세분화 프레임워크에 자기주의 메커니즘을 통합한다.
  • 공간적 사전으로 클래스에 관계없는 자극 지도를 사용하여 주의 전파를 제약하고 배경 영역으로의 확산을 방지한다.
  • 클래스별 주의 힌트를 추가적인 감독으로 통합하여 전경 객체 간의 상호 클래스 주의 오류 확산을 줄인다.
  • 시드 세그먼테이션 브랜치와 이미지 분류 브랜치를 갖춘 이중 브랜치 네트워크를 사용하며, 분류 및 시드 감독을 결합한 가중치 손실을 통해 공동으로 훈련한다.
  • 자기주의 모듈 내에서 자극과 주의 사전을 적응적으로 융합하여 위치 정확도를 향상시킨다.
  • 동일한 훈련 프레임워크 내에서 자극과 주의 사전을 부분적인 참조 세그먼테이션 마스크로 교체함으로써 준감독 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1자기주의 메커니즘이 배경이나 다른 객체 카테고리로의 주의 오확산 없이 약한 감독 세분화에서 장거리 맥락을 효과적으로 포착할 수 있는가?
  • RQ2밀도 있는 감독이 없는 상황에서 클래스에 관계없는 자극 지도가 주의 기반 위치 추정의 신뢰성을 어떻게 향상시킬 수 있는가?
  • RQ3클래스별 주의 힌트가 상호 클래스 주의 혼동을 얼마나 줄이고 시드 품질을 향상시킬 수 있는가?
  • RQ4약한 감독으로 훈련된 동일한 아키텍처가 자극을 부분적인 참조로 교체함으로써 준감독 학습으로 효과적으로 적응될 수 있는가?

주요 결과

  • 제안된 SGAN은 약한 감독 학습 하에서 PASCAL VOC 2012 검증 세트에서 64.2%의 mIoU를 달성하여 이전 최신 기술 수준의 모든 방법을 능가한다.
  • 전체 SGAN 모델은 시드 품질에서 73.0의 F-측정치를 기록하여 기준 모델(61.5)과 다른 변형보다 뚜렷이 높은 정확도와 재현율을 보이며, 뛰어난 시드 위치 정확도를 입증한다.
  • 제거 실험 결과, 자극과 클래스별 주의 힌트를 모두 통합한 경우 mIoU가 최고 수준(64.2%)을 기록하여 두 사전의 상호 보완적 이점이 입증된다.
  • 시드 손실의 최적 가중치 요소 λ = 0.15가 가장 뛰어난 세그먼테이션 성능을 내며, λ가 너무 높거나 너무 낮을 경우 mIoU가 감소함을 보였다.
  • 자극 검출기의 선택에 대해 강건한 성능을 보이며, S-Net을 사용할 경우 64.2%, DSS를 사용할 경우 64.0%, DHSNet을 사용할 경우 63.7%의 mIoU를 기록하여 자극 품질에 대한 민감도가 낮음을 시사한다.
  • 자극과 주의 사전을 부분적인 참조 마스크로 교체함으로써 SGAN은 아키텍처 변경 없이도 준감독 학습으로 효과적으로 일반화되어 강력한 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.