[논문 리뷰] Unveiling the Potential of Structure Preserving for Weakly Supervised Object Localization
이 논문은 구조 보존 활성화( SPA )를 제안하며, 합성곱 특징 내의 공간적 구조를 보존함으로써 정규화된 정확도를 향상시키는 이중 단계 방법이다. 과도하게 확신하는 반응을 억제하기 위해 제한된 활성화 모듈(RAM)을 도입하고, 고차수 상호상관을 사용하여 장거리 공간적 레이아웃을 포착하는 자기상관맵 생성(SCG) 모듈을 제안하여 CUB-200-2011 및 ILSVRC에서 최신 기준 성능을 달성했으며, 다양한 백본에서 일관된 성능 향상을 보였다.
Weakly supervised object localization(WSOL) remains an open problem given the deficiency of finding object extent information using a classification network. Although prior works struggled to localize objects through various spatial regularization strategies, we argue that how to extract object structural information from the trained classification network is neglected. In this paper, we propose a two-stage approach, termed structure-preserving activation (SPA), toward fully leveraging the structure information incorporated in convolutional features for WSOL. First, a restricted activation module (RAM) is designed to alleviate the structure-missing issue caused by the classification network on the basis of the observation that the unbounded classification map and global average pooling layer drive the network to focus only on object parts. Second, we designed a post-process approach, termed self-correlation map generating (SCG) module to obtain structure-preserving localization maps on the basis of the activation maps acquired from the first stage. Specifically, we utilize the high-order self-correlation (HSC) to extract the inherent structural information retained in the learned model and then aggregate HSC of multiple points for precise object localization. Extensive experiments on two publicly available benchmarks including CUB-200-2011 and ILSVRC show that the proposed SPA achieves substantial and consistent performance gains compared with baseline approaches.Code and models are available at https://github.com/Panxjia/SPA_CVPR2021
연구 동기 및 목표
- 전역 평균 풀링과 무제한 활성화 맵으로 인해 분류 네트워크가 객체의 구조적 정보를 보존하지 못하는 약한 감독 하의 객체 국지화(WSOL)의 한계를 해결하기 위해.
- 인스턴스 수준의 애너테이션 없이도 합성곱 특징 내의 고유한 공간적 구조를 어떻게 활용하여 더 정확한 국지화를 달성할 수 있는지 탐구하기 위해.
- 순수하게 공간 정규화나 CAM 기반 활성화에 의존하는 것이 아니라, 특징 수준의 상관관계를 통해 구조 레이아웃을 보존함으로써 국지화 맵을 향상시키는 방법을 개발하기 위해.
- 과도한 활성화 반응으로 인한 구조 누락 및 잘못된 경고(가짜 양성) 등의 국지화 오류를 고차수 상호상관을 활용한 활성화 맵 정밀 조정을 통해 줄이기 위해.
제안 방법
- 분류 활성화 맵(CAMs)의 반응 범위를 제한하여 과도하게 강조되는 특징 부분을 방지하고, 가짜 마스크 가이던스를 통해 배경 구분 능력을 향상시키기 위해 제한된 활성화 모듈(RAM)을 도입하였다.
- 장거리 공간적 의존성을 추출하기 위해 특징 맵 간의 고차수 상호상관(HSC)을 계산하는 자기상관맵 생성(SCG) 모듈을 제안하였다.
- 다양한 점들 간의 공간적 관계를 집계하는 미분 가능한 상관 연산을 사용하여 HSC를 계산함으로써 정밀한 객체 레이아웃을 포착하였다.
- RAM에서 얻은 활성화 맵을 고차수 상호상관 응답을 집계하여 보다 구조 보존이 이루어진 국지화 맵을 생성하는 데 SCG 모듈을 활용하였다.
- 이중 단계 파ip라인을 적용함: 먼저 RAM이 CAMs를 정제하고, 이후 SCG 모듈이 HSC 기반 상관을 사용하여 최종 국지화 맵을 생성하였다.
- 표준 CNN 백본(예: VGG16, Inception V3)과 호환되며, 계산 오버헤드가 극히 미미하다.
![Figure 2: Framework of the proposed SPA approach. During the training phase, we designed a restricted activation module paralleled with the classification branch on the baseline architecture of simplified CAM [ 43 ] . In the inference phase, we proposed a self-correlation map generating module, whic](https://ar5iv.labs.arxiv.org/html/2103.04523/assets/x5.png)
실험 결과
연구 질문
- RQ1합성곱 특징 내의 공간적 구조를 보존함으로써 기존 CAM 기반 방법을 초월하여 약한 감독 하의 객체 국지화 성능을 향상시킬 수 있는가?
- RQ2분류 네트워크의 헤드 부분이 특징 맵 내에서 객체의 구조적 정보를 어느 정도 억제하는가?
- RQ3고차수 상호상관은 일차 상관이 모델링하지 못하는 장거리 공간적 레이아웃을 효과적으로 포착할 수 있는가?
- RQ4제한된 활성화와 구조 인식 상관을 조합함으로써 다양한 벤치마크에서 일관된 성능 향상이 달성되는가?
주요 결과
- ILSVRC 검증 세트에서 VGG16를 사용할 경우, RAM과 SCG를 모두 적용한 SPA는 기준값(53.76%)에서 Top-1 국지화 오차를 50.44%로 감소시켜 3.1%p의 절대적 향상률을 기록하였다.
- CUB-200-2011에서 VGG16를 사용할 경우, RAM과 SCG를 조합한 결과 Top-1 국지화 오차가 57.49%에서 39.73%로 17.7% 감소하였다.
- Inception V3를 사용할 경우, CUB-200-2011에서 기준 대비 9.2% 감소하고 ILSVRC에서는 2.59% 감소한 것으로 나타났다.
- SCG 모듈만으로도 CUB-200-2011에서 VGG16 기준으로 성능 향상이 11.5% 발생하여, 구조적 레이아웃을 포착하는 데 효과적임을 입증하였다.
- RAM 모듈은 CUB-200-2011에서 VGG16 기준으로 국지화 오차를 8.1% 감소시켜, 과도하게 확신하는 반응으로 인한 구조 누락 문제를 완화하는 데 기여함을 확인하였다.
- CUB-200-2011 및 ILSVRC에서 모두 최신 기준 성능을 달성하였으며, 다양한 백본과 국지화 메트릭에서 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.