[논문 리뷰] Constrained Sampling for Class-Agnostic Weakly Supervised Object Localization
이 논문은 자기지도 학습 Vision Transformer를 사용하여 고해상도, 임계값 없는 가짜 레이블을 생성함으로써, 클래스에 관계없이 제약 조건이 있는 샘플링 방법을 제안한다. [cls] 토큰에서 유도된 어텐션 맵을 활용하고, Otsu 임계값 설정을 통해 다수의 객체 후보를 선택함으로써 정밀한 전경 및 배경 마스크를 생성하며, 교차 엔트로피 손실을 사용한 엔드 투 엔드 학습을 가능하게 하여 CUB-200-2011에서 최고 성능을 기록하며 MaxBoxAccV2 평균 점수 90.9%를 달성한다.
Self-supervised vision transformers can generate accurate localization maps of the objects in an image. However, since they decompose the scene into multiple maps containing various objects, and they do not rely on any explicit supervisory signal, they cannot distinguish between the object of interest from other objects, as required in weakly-supervised object localization (WSOL). To address this issue, we propose leveraging the multiple maps generated by the different transformer heads to acquire pseudo-labels for training a WSOL model. In particular, a new discriminative proposals sampling method is introduced that relies on a pretrained CNN classifier to identify discriminative regions. Then, foreground and background pixels are sampled from these regions in order to train a WSOL model for generating activation maps that can accurately localize objects belonging to a specific class. Empirical results on the challenging CUB benchmark dataset indicate that our proposed approach can outperform state-of-art methods over a wide range of threshold values. Our method provides class activation maps with a better coverage of foreground object regions w.r.t. the background.
연구 동기 및 목표
- 약한 감독 객체 지도에서 기존 CAM 방법의 해상도가 낮고 임계값에 민감한 문제를 해결하기 위해.
- 각 이미지의 임계값 조정 없이 정밀한 고해상도 가짜 레이블을 생성함으로써 정위치 정확도를 향상시키기 위해.
- [cls] 토큰 기반 픽셀 샘플링을 통해 이미지 레벨 레이블만으로도 클래스에 관계없는 정위치를 가능하게 하기 위해.
- 조건부 랜덤 필드 및 보조 손실을 활용하여 정확도와 경계 정렬을 향상시키기 위해.
- 새로운 가짜 레이블링 파이프라인을 사용하여 CUB-200-2011 벤치마크에서 최고 성능을 달성하기 위해.
제안 방법
- 최종 트랜스포머 레이어의 [cls] 토큰에서 유도된 어텐션 맵을 생성하기 위해 자기지도 학습 Vision Transformer를 사용한다.
- 첫 네 개의 어텐션 맵과 그 평균을 조합하여 다섯 개의 후보 맵을 생성하고, 객체 후보 생성에 활용한다.
- 다섯 개의 맵 각각에 대해 Otsu 임계값 설정을 적용하여 이진 마스크를 생성하고, 각 이미지당 최대 n개의 바운딩 박스를 추출한다.
- 분류기 추론을 위해 각 바운딩 박스 외부의 배경 영역을 양방향 가우시안 블러로 억제하는 이미지 클립을 생성한다.
- 분류기 신뢰도와 해당 어텐션 맵을 기반으로 최상의 후보를 선택하고, 상위 n% 및 하위 n% 활성화 픽셀을 통해 전경 및 배경 영역을 정의한다.
- 결과로 생성된 가짜 레이블에 표준 교차 엔트로피 손실을 사용하여 정위치 헤드를 학습하며, 경계 정밀도 향상을 위해 선택적 CRF 및 조건부 손실을 통합한다.
실험 결과
연구 질문
- RQ1자기지도 학습 Vision Transformer에서 유도된 어텐션 맵을 사용하여 약한 감독 객체 지도에서 신뢰할 수 있고 클래스에 관계없는 가짜 레이블을 생성할 수 있는가?
- RQ2다수의 어텐션 맵에서 제약 조건이 있는 샘플링을 통해 CAM 기반 정위치에서 각 이미지의 임계값 설정에 대한 의존도를 줄일 수 있는가?
- RQ3제안된 방법이 표준 벤치마크에서 최고 성능을 기록한 CAM 기반 접근법보다 정위치 정확도를 향상시킬 수 있는가?
- RQ4CRF 및 조건부 손실과 같은 보조 손실이 가짜 레이블의 경계 정렬 및 강건성을 향상시킬 수 있는가?
- RQ5이 방법은 수동 임계값 조정이 필요 없이 정위치 성능을 유지하거나 향상시킬 수 있는가?
주요 결과
- 제안된 방법은 CUB-200-2011 데이터셋에서 90.9%의 평균 MaxBoxAccV2 점수를 기록하며, 이는 이전의 모든 최고 성능 방법을 초월한다.
- VGG에서 97.0%의 MaxBoxAcc를 달성하여 이전 최고 성능인 F-CAM의 91.5%를 크게 상회한다.
- 활성화 점수 분포에서 전경 및 배경 영역 간 명확한 분리가 관찰되어 각 이미지의 임계값 설정이 필요 없어졌다.
- 다수의 어텐션 맵을 활용함으로써 이미지당 다중 객체 탐지가 가능해져 부분적 또는 다중 객체 시나리오에 대한 강건성이 향상되었다.
- CRF 및 조건부 랜덤 필드 손실을 통합함으로써 노이즈가 있는 가짜 레이블에도 불구하고 경계 정렬과 맵의 강건성이 향상되었다.
- 이 방법은 클래스에 관계없고, 전경/배경 두 채널의 가짜 레이블만을 사용하므로 학습 및 추론 과정이 단순화된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.