Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive learning of Class-agnostic Activation Map for Weakly Supervised Object Localization and Semantic Segmentation

Jinheng Xie, Jianfeng Xiang|arXiv (Cornell University)|2022. 03. 25.
Advanced Neural Network Applications인용 수 7
한 줄 요약

이 논문은 대상에 관계없이 활성화 맵(C²AM)을 위한 대비 학습을 제안한다. 이는 레이블이 없는 이미지만을 사용하여 완전하고 신뢰할 수 있는 전경 객체 영역을 생성하는 자기 지율적 방법이다. 교차 이미지 전경-배경 특징을 대비하고, 특징 유사도 기반 순위 가중치를 적용함으로써 C²AM은 클래스에 관계없는 활성화 맵을 생성한다. 이는 약한 감독을 받는 객체 탐지(WSOL)와 의미적 세그멘테이션(WSSS)을 향상시키며, 기준 CAMs 대비 최대 17.5%의 mIoU 향상을 달성한다.

ABSTRACT

While class activation map (CAM) generated by image classification network has been widely used for weakly supervised object localization (WSOL) and semantic segmentation (WSSS), such classifiers usually focus on discriminative object regions. In this paper, we propose Contrastive learning for Class-agnostic Activation Map (C$^2$AM) generation only using unlabeled image data, without the involvement of image-level supervision. The core idea comes from the observation that i) semantic information of foreground objects usually differs from their backgrounds; ii) foreground objects with similar appearance or background with similar color/texture have similar representations in the feature space. We form the positive and negative pairs based on the above relations and force the network to disentangle foreground and background with a class-agnostic activation map using a novel contrastive loss. As the network is guided to discriminate cross-image foreground-background, the class-agnostic activation maps learned by our approach generate more complete object regions. We successfully extracted from C$^2$AM class-agnostic object bounding boxes for object localization and background cues to refine CAM generated by classification network for semantic segmentation. Extensive experiments on CUB-200-2011, ImageNet-1K, and PASCAL VOC2012 datasets show that both WSOL and WSSS can benefit from the proposed C$^2$AM.

연구 동기 및 목표

  • 약한 감독을 받는 객체 탐지(WSOL)와 의미적 세그멘테이션(WSSS)에서 클래스 활성화 맵(CAMs)이 흔히 흩어진, 특징적인 영역에만 집중하는 한계를 해결하기 위해.
  • 이미지 수준의 애너테이션을 요구하지 않고도 더 완전하고 신뢰할 수 있는 전경 객체 영역을 학습하기 위해.
  • 교차 이미지 전경-배경 대비를 활용하여 객체와 배경 표현을 분리하는 자기 지율적 방법을 개발하기 위해.
  • C²AM을 사용해 CAMs를 대체하거나 개선함으로써 WSOL과 WSSS 성능을 향상시키기 위해.

제안 방법

  • C²AM은 각 이미지당 하나의 클래스에 관계없는 활성화 맵을 생성하여 전경과 배경 영역을 구분한다.
  • 양성 쌍은 유사한 외관을 가진 전경 또는 유사한 질감/색상의 배경에서 형성되고, 음성 쌍은 이미지 간 전경-배경에서 형성되는 대비 손실을 사용한다.
  • 특징 유사도 기반 순위 가중치 메커니즘이 대비 학습 중에 유사하지 않은 양성 쌍(예: 다른 외관의 객체)의 영향을 줄인다.
  • 활성화 헤드는 무작위로 초기화되고, 대비 손실을 사용하여 엔드 투 엔드로 훈련되어 점차 전경과 배경 특징을 분리한다.
  • 결과적으로 생성된 클래스에 관계없는 활성화 맵은 CAMs를 개선하기 위해 보다 정교한 의미적 세그멘테이션을 위한 배경 힌트를 추출하는 데 사용된다.
  • 이 방법은 레이블이 없는 이미지 데이터만으로 훈련되어 이미지 수준의 지도가 필요 없게 된다.

실험 결과

연구 질문

  • RQ1레이블이 없는 데이터에서 자기 지율적 대비 학습이 클래스 특정 CAMs보다 더 완전하고 신뢰할 수 있는 전경 객체 영역을 생성할 수 있는가?
  • RQ2이미지 수준의 지도 없이 교차 이미지 전경-배경 대비가 객체와 배경 표현을 얼마나 효과적으로 분리하는가?
  • RQ3C²AM에서 생성된 클래스에 관계없는 활성화 맵을 사용해 CAMs를 개선함으로써 WSOL과 WSSS 성능을 향상시킬 수 있는가?
  • RQ4활성화 헤드의 초기화 및 순위 가중치 인자 α와 같은 초모델 하이퍼파라미터에 대해 C²AM의 민감도는 어떠한가?

주요 결과

  • C²AM은 ImageNet-1K에서 기준 PSA 방법 대비 mIoU를 17.5% 향상시키고, SC-CAM 대비 15.1% 향상시켰다.
  • C²AM에서 추출한 배경 힌트는 완전히 지도된 시각화 감지기보다 잘못된 배경 활성화를 줄이는 데 더 뛰어났다.
  • ImageNet-1K에서 GT 기반의 정확도는 활성화 헤드의 초기화 방법에 관계없이 안정적이었으며, 가중치 초기화에 대해 낮은 민감도를 보였다.
  • 순위 가중치 메커니즘의 하이퍼파라미터 α가 0을 초과할 경우 성능 향상이 뚜렷했으며, α 값이 0.1에서 0.9 사이일 때 안정적인 결과를 보였다.
  • 시각화 결과에서 C²AM은 잘못된 배경 활성화를 효과적으로 억제하고, 개선된 CAMs에서 누락된 객체 부분(예: 소 몸통, 말 다리)을 복구하는 데 성공했다.
  • 훈련 중에 어떤 이미지 수준의 애너테이션도 사용하지 않아도, WSOL과 WSSS 과제에서 최신 기술 수준의 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.