[논문 리뷰] Zoom-CAM: Generating Fine-grained Pixel Annotations from Image Labels
Zoom-CAM는 최종 합성곱층 외에도 모든 중간 합성곱층의 클래스 활성화 맵을 통합하여 더 높은 해상도의 세밀한 픽셀 수준의 가짜 레이블을 생성함으로써 약한 감독 기반 객체 탐지 및 세분화를 향상시킨다. 이 방법은 국소화 노이즈를 감소시키고 기존 기준 방법에서 놓친 소규모 객체를 포착하며, ImageNet에서 상위-1 오류율을 2.8% 감소시키고 약한 감독 기반 세분화에서 mIoU를 1.1% 향상시킨다.
Current weakly supervised object localization and segmentation rely on class-discriminative visualization techniques to generate pseudo-labels for pixel-level training. Such visualization methods, including class activation mapping (CAM) and Grad-CAM, use only the deepest, lowest resolution convolutional layer, missing all information in intermediate layers. We propose Zoom-CAM: going beyond the last lowest resolution layer by integrating the importance maps over all activations in intermediate layers. Zoom-CAM captures fine-grained small-scale objects for various discriminative class instances, which are commonly missed by the baseline visualization methods. We focus on generating pixel-level pseudo-labels from class labels. The quality of our pseudo-labels evaluated on the ImageNet localization task exhibits more than 2.8% improvement on top-1 error. For weakly supervised semantic segmentation our generated pseudo-labels improve a state of the art model by 1.1%.
연구 동기 및 목표
- 기존의 약한 감독 기반 방법이 가짜 레이블 생성을 위해 최종 저해상도 합성곱층에만 의존하는 한계를 해결하기 위해.
- Grad-CAM 및 CAM이 놓치는 소규모 또는 세밀한 객체 인스턴스에 대한 국소화 정확도를 향상시키기 위해.
- 모든 중간층의 특징 맵을 활용하여 이미지 수준의 레이블에서 고해상도의 정밀한 시각적 설명을 생성하는 방법을 개발하기 위해.
- 다양한 층을 통합함으로써 노이즈를 감소시키고 약한 감독 기반 세분화에서 국소화의 정밀도를 향상시킬 수 있음을 입증하기 위해.
제안 방법
- Zoom-CAM는 최종 층 외에도 모든 중간 합성곱층을 통해 클래스 점수 기울기의 역전파를 수행하여 기울기 기반 중요도 맵을 계산한다.
- 모든 중간층의 활성화 맵을 선형적으로 조합하기 위해 학습 가능한 가중치 마스크를 적용하여 클래스에 특화된 중요도를 최적화한다.
- 융합된 활성화 맵을 입력 이미지 해상도로 조정하여 고해상도의 시각적 설명을 생성하고, 이를 가짜 레이블링에 활용한다.
- 임계값 설정 및 연결된 성분 분석 전략을 사용하여 융합된 맵에서 주목할 만한 영역을 추출하여 가짜 세분화 레이블로 활용한다.
- 표준 CNN과 호환되며 표준 역전파 외에 추가적인 계산 부담이 거의 없다.
- CAM 또는 Grad-CAM을 대체하여 이미지 수준의 감독에서 더 정확한 가짜 레이블을 생성함으로써 약한 감독 파이프라인에 통합된다.
실험 결과
연구 질문
- RQ1모든 중간 합성곱층의 특징 맵을 통합하면 약한 감독 기반 국소화에서 가짜 레이블의 정밀도를 향상시킬 수 있는가?
- RQ2최종 층에만 의존하는 것과 비교해 여러 층을 사용할 경우 국소화 노이즈를 줄이고 소규모 또는 세밀한 객체 인스턴스를 더 잘 포착할 수 있는가?
- RQ3국소화 및 세분화 정확도 측면에서 Zoom-CAM의 성능은 Grad-CAM 및 Score-CAM과 같은 최신 시각화 방법과 비교해 어떻게 되는가?
- RQ4Zoom-CAM가 생성한 가짜 레이블은 최신 약한 감독 기반 세분화 모델의 성능을 향상시킬 수 있는가?
주요 결과
- ImageNet 국소화 벤치마크에서 Zoom-CAM는 Grad-CAM 대비 상위-1 오류율을 2.8% 감소시키고 상위-5 오류율을 3.7% 감소시켰다.
- PASCAL VOC 2012 데이터셋에서 Zoom-CAM가 생성한 가짜 레이블은 CAM, Grad-CAM, Score-CAM 및 Grad-CAM++보다 더 높은 mIoU를 달성했다.
- 최신의 IRNet 모델을 약한 감독 기반 세분화를 위해 재학습할 때 Zoom-CAM는 mIoU를 1.1% 향상시켰다.
- 시각적 점검 결과 Zoom-CAM는 동일한 클래스의 다중 인스턴스와 Grad-CAM가 놓친 소규모 객체를 성공적으로 국소화함을 확인했다.
- 주요 비용이 여전히 역전파이므로 Zoom-CAM는 Grad-CAM와 유사한 계산 효율성을 유지한다.
- 중간층 맵의 융합은 배경 과도 활성화를 감소시키고 공간적 국소화 정밀도를 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.