Skip to main content
QUICK REVIEW

[논문 리뷰] Decoupled Spatial Neural Attention for Weakly Supervised Semantic Segmentation

Tianyi Zhang, Guosheng Lin|arXiv (Cornell University)|2018. 03. 07.
Multimodal Machine Learning Applications참고 문헌 39인용 수 10
한 줄 요약

이 논문은 단일 순방향 전파에서 객체 영역과 분류에 유의미한 부분을 동시에 식별하는 분리된 공간 신경망 주의 메커니즘을 제안한다. 이를 통해 이미지 수준의 레이블만을 사용하여 고품질의 가짜 애너테이션을 생성하고, 약한 지도 학습 세그멘테이션에서 최상의 성능을 달성한다. 동일한 지도 학습 설정에서 반복 학습이나 외부 데이터 없이도, PASCAL VOC 2012 벤치마크에서 테스트 세트에서 56.4%의 mIoU를 기록하며 기존 방법들을 능가한다.

ABSTRACT

Weakly supervised semantic segmentation receives much research attention since it alleviates the need to obtain a large amount of dense pixel-wise ground-truth annotations for the training images. Compared with other forms of weak supervision, image labels are quite efficient to obtain. In our work, we focus on the weakly supervised semantic segmentation with image label annotations. Recent progress for this task has been largely dependent on the quality of generated pseudo-annotations. In this work, inspired by spatial neural-attention for image captioning, we propose a decoupled spatial neural attention network for generating pseudo-annotations. Our decoupled attention structure could simultaneously identify the object regions and localize the discriminative parts which generates high-quality pseudo-annotations in one forward path. The generated pseudo-annotations lead to the segmentation results which achieve the state-of-the-art in weakly-supervised semantic segmentation.

연구 동기 및 목표

  • 이미지 수준의 레이블만을 사용하여 약한 지도 학습 세그멘테이션을 위한 고품질의 가짜 애너테이션을 생성하는 데 도전한다.
  • 기존의 상향식 시각적 강조 방법이 분류에 중요한 부분에만 집중하고 전체 객체 영역을 놓치는 한계를 극복한다.
  • 히우리스틱적인 다단계 학습이나 외부 데이터에 의존하지 않는 간단하고 종단 간 전이적, 반복적이지 않은 파이프라인을 개발한다.
  • 분리된 주의 메커니즘을 통해 객체 영역과 분류에 중요한 부분을 동시에 모델링하여 세그멘테이션 성능을 향상시킨다.

제안 방법

  • 단일 순방향 전파에서 두 개의 서로 다른 클래스별 주의 맵을 생성하는 분리된 공간 신경망 주의 모듈을 제안한다.
  • 확장형 주의 맵은 객체 영역의 전체 범위를 식별하는 데 집중하고, 분류적 주의 맵은 핵심적인 분류에 중요한 부분을 강조한다.
  • 두 주의 맵은 상호 보완적이며, 함께 사용되어 더 정확한 가짜 애너테이션을 생성하는 데 사용된다.
  • 이 방법은 두 단계 파이프라인에 통합된다: 첫 번째 단계에서는 분리된 주의 네트워크가 이미지 수준의 레이블에서 가짜 애너테이션을 생성하고, 두 번째 단계에서는 이러한 가짜 애너테이션을 사용해 DeepLab 유사 세그멘테이션 네트워크를 훈련시킨다.
  • 전체 파이프라인은 반복적 보정이나 외부 지도 없이 단일 전파에서 종단 간 전이적으로 훈련된다.
  • 세그멘테이션 헤드의 백본 네트워크로 ResNet-101과 VGG-16를 사용하며, 분리된 주의 모듈은 최종 분류 레이어 이전에 적용된다.

실험 결과

연구 질문

  • RQ1단일 종단 간 주의 메커니즘이 동시에 전체 객체 영역과 분류에 중요한 부분을 효과적으로 국소화할 수 있는가?
  • RQ2두 상호 보완적인 주의 맵으로 공간 주의를 분리하면 기존의 상향식 시각적 강조 방법보다 가짜 애너테이션 품질이 향상되는가?
  • RQ3반복적이지 않고 한 번의 전파만으로도 약한 지도 학습 세그멘테이션에서 최고 성능을 달성할 수 있는가?
  • RQ4외부 데이터나 반복 보정을 사용하는 기존 방법들과 비교해 본 논문의 방법은 어떻게 다른가?

주요 결과

  • 제안된 방법은 PASCAL VOC 2012 테스트 세트에서 평균 교차율(mIoU) 56.4%를 기록하여, 동일한 지도 학습 설정에서 약한 지도 학습 세그멘테이션 분야에서 새로운 최고 기록을 수립한다.
  • ResNet-101 백본을 사용할 경우, 테스트 세트에서 60.1%의 mIoU를 기록하며, 외부 데이터 없이 이미지 수준의 레이블만을 사용하는 모든 기존 방법들을 능가한다.
  • 제거 분석 결과, 확장형 주의 맵과 분류적 주의 맵 모두 성능 향상에 기여하며, 분리된 설계가 단일 주의 기반 베이스라인보다 뛰어난 성능을 낸다.
  • 반복 학습이나 외부 데이터 없이도 뛰어난 성능을 달성하여, 기존 방법보다 더 단순하고 효율적인 파이프라인임을 입증한다.
  • 그림 7의 정성적 결과는 생성된 가짜 애너테이션이 특히 전체 객체 형태와 핵심 부분을 잘 포착하면서 진짜 마스크와 유사하게 나타남을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.