[논문 리뷰] Shallow Feature Matters for Weakly Supervised Object Localization
이 논문은 깊이 있는 특징과 얕은 특징을 곱셈 기반 융합을 통해 배경 잡음을 억제하고 경계 정확도를 향상시키는 새로운 약한 지도 학습 객체 지역화 방법인 SPOL을 제안한다. 의사 레이블링 전략과 가우시안 사전 확률 향상, 클래스 무관 세그멘테이션 헤드를 결합함으로써 SPOL은 CUB-200에서 3.93% 향상된 Top-5 지역화 정확도와 ImageNet-1K에서 2.13% 향상된 성능을 달성하여 최신 기준 성능을 확립한다.
Weakly supervised object localization (WSOL) aims to localize objects by only utilizing image-level labels. Class activation maps (CAMs) are the commonly used features to achieve WSOL. However, previous CAM-based methods did not take full advantage of the shallow features, despite their importance for WSOL. Because shallow features are easily buried in background noise through conventional fusion. In this paper, we propose a simple but effective Shallow feature-aware Pseudo supervised Object Localization (SPOL) model for accurate WSOL, which makes the utmost of low-level features embedded in shallow layers. In practice, our SPOL model first generates the CAMs through a novel element-wise multiplication of shallow and deep feature maps, which filters the background noise and generates sharper boundaries robustly. Besides, we further propose a general class-agnostic segmentation model to achieve the accurate object mask, by only using the initial CAMs as the pseudo label without any extra annotation. Eventually, a bounding box extractor is applied to the object mask to locate the target. Experiments verify that our SPOL outperforms the state-of-the-art on both CUB-200 and ImageNet-1K benchmarks, achieving 93.44% and 67.15% (i.e., 3.93% and 2.13% improvement) Top-5 localization accuracy, respectively.
연구 동기 및 목표
- 기존의 약한 지도 학습 객체 지역화(WSOL) 방법에서 얕은 특징가 적극적으로 활용되지 않는 문제를 해결하기 위해, 기존 융합 전략에서 배경 잡음에 의해 압도당하는 얕은 특징의 잠재력을 효과적으로 활용하는 것.
- 얕은 특징과 깊은 특징의 상호보완적 융합을 통해 객체 경계의 명확성을 향상시키고 오분류를 줄임으로써 지역화 정확도를 향상시키는 것.
- 초기 클래스 활성화 맵(CAMs)을 의사 레이블로 사용하여 클래스 무관 세그멘테이션 모델을 훈련시켜 더 완전한 객체 마스크로 개선하는 것.
- 경계 상자 레이블이 필요 없도록 이미지 수준의 레이블만을 사용하고, 가우시안 사전 모델링을 통해 고품질의 의사 레이블을 생성함으로써 레이블링 과정의 간소화를 달성하는 것.
제안 방법
- 얕은 특징맵과 깊은 특징맵을 요소별 곱셈을 통해 융합하는 다층적 특징 융합 네트워크(MFF-Net)를 제안하여 잡음 상호 억제와 객체 경계 강화를 가능하게 한다.
- CAM 반응의 평균과 분산을 모든 공간 위치에서 계산하여 객체의 질량 중심을 강조하는 공간 사전을 생성하는 가우시안 사전 의사 레이블(GPPL) 모듈을 도입한다.
- 결합된 CAM과 GPPL을 의사 레이블로 사용하여 클래스 무관 세그멘테이션 모델을 훈련시키며, 부분적인 활성화를 보완함으로써 객체 마스크를 정밀하게 개선한다.
- 훈련 중 레이블 충돌을 해결하기 위해 이중 임계값 기반 이진화를 적용: 고응답 영역은 전경으로, 저응답 영역은 배경으로 간주하고 중간 영역는 무시한다.
- 특징 표현 향상과 잡음 억제를 위해 MFF-Net에 보조 손실과 곱셈 기반 채널별 주의 메커니즘(MCA)을 도입한다.
- 최종으로 정제된 마스크에서 경계 상자를 추출하여 최종 객체 지역화 예측을 생성한다.

실험 결과
연구 질문
- RQ1얕은 특징은 높은 잡음 수준을 지니고 있음에도 불구하고, 깊은 특징과 적절히 융합될 경우 약한 지도 학습 객체 지역화에서 효과적으로 활용될 수 있는가?
- RQ2얕은 특징과 깊은 특징의 곱셈 기반 융합이 덧셈 또는 연결 기반 융합보다 객체 경계 유지 및 배경 응답 억제에 더 우수한 성능을 보이는가?
- RQ3초기 CAM과 가우시안 사전에서 유도된 의사 레이블로 훈련된 클래스 무관 세그멘테이션 모델이 객체 마스크의 완전성과 지역화 정확도를 크게 향상시킬 수 있는가?
- RQ4각 구성 요소인 MCA, 보조 손실, 임계값 설정, 가우시안 사전 향상이 최종 지역화 성능에 미치는 영향은 어떠한가?
주요 결과
- CUB-200에서 SPOL은 Top-5 지역화 정확도 93.44%를 달성하여 이전 최신 기준 성능 대비 3.93% 향상되었다.
- ImageNet-1K에서 SPOL은 67.15%의 Top-5 지역화 정확도를 기록하여 이전 최신 기준 방법 대비 2.13% 향상되었다.
- 제거 실험 결과, 곱셈 기반 채널별 주의(MCA) 모듈을 제거하면 GT-Known Loc가 92.25%에서 88.52%로 감소하여 잡음 억제에 핵심적인 역할을 한다는 것을 입증했다.
- 보조 손실을 제거하면 모델 수렴이 저하되며, GT-Known Loc가 92.25%에서 89.45%로 감소함을 확인했다.
- 클래스 무관 세그멘테이션 모델은 성능 향상에 크게 기여하며, 이를 제거하면 GT-Known Loc가 96.46%에서 92.25%로 감소한다.
- 임계값 설정과 가우시안 사전 향상 모두 필수적이다. 둘 중 하나를 생략할 경우 성능 저하가 심각하게 발생하며, 가우시안 사전 향상 없이 사용할 경우 95.41%, 임계값 없이 사용할 경우 73.97%의 GT-Known Loc를 기록한다.
![Figure 2: Variants of activated regions. (a) Input image. (b) Original CAM [ 28 ] . (c) Gaussian prior pseudo labels using original CAM as the weighting coefficients. (d) Gaussian prior pseudo labels combined with original CAM. (e) Object mask predicted by the proposed class-agnostic segmentation mo](https://ar5iv.labs.arxiv.org/html/2108.00873/assets/x1.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.