[논문 리뷰] Re-Attention Transformer for Weakly Supervised Object Localization
이 논문은 배경 노이즈를 억제하고 클래스 활성화 맵을 사용하여 주의 맵을 정교화함으로써 약한 감독 하의 객체 검출 성능을 햖스시키는 재주목 메커니즘인 토큰 정밀화 트랜스포머(TRT)를 제안한다. TRT는 토큰 우선순위 점수 모듈(TPSM)과 적응형 임계값 설정을 도입하여 ILSVRC 및 CUB-200-2011 벤치마크에서 각각 82.08% 및 91.1%의 정확도로 최신 기술을 달성한다.
Weakly supervised object localization is a challenging task which aims to localize objects with coarse annotations such as image categories. Existing deep network approaches are mainly based on class activation map, which focuses on highlighting discriminative local region while ignoring the full object. In addition, the emerging transformer-based techniques constantly put a lot of emphasis on the backdrop that impedes the ability to identify complete objects. To address these issues, we present a re-attention mechanism termed token refinement transformer (TRT) that captures the object-level semantics to guide the localization well. Specifically, TRT introduces a novel module named token priority scoring module (TPSM) to suppress the effects of background noise while focusing on the target object. Then, we incorporate the class activation map as the semantically aware input to restrain the attention map to the target object. Extensive experiments on two benchmarks showcase the superiority of our proposed method against existing methods with image category annotations. Source code is available in \url{https://github.com/su-hui-zz/ReAttentionTransformer}.
연구 동기 및 목표
- 약한 감독 하에서 전체 객체를 식별하는 데에 한계가 있는 기존 방법의 문제를 해결하기 위해.
- 전역 자기주목 주의로 인해 관련이 없는 영역에 주목하는 경향이 있는 비전 트랜스포머에서 배경 간섭을 줄이기 위해.
- 주의 맵 정교화를 위한 의미적 가이던스로 클래스 활성화 맵(CAM)을 통합하여 정밀도를 향상시키기 위해.
- 상위-K 또는 고정 임계값 설정보다 더 효과적인 토큰 선택 전략을 개발하기 위해.
제안 방법
- 객체 수준의 의미 정보를 사용하여 주의 맵을 정교화하는 재주목 메커니즘인 토큰 정밀화 트랜스포머(TRT)를 제안한다.
- 응답 강도와 배경 억제를 기반으로 주의 맵 토큰을 재점수하는 데 사용되는 토큰 우선순위 점수 모듈(TPSM)을 도입한다.
- 주목 맵이 대상 객체에 집중하도록 제약을 주기 위해 클래스 활성화 맵(CAM)을 의미적으로 인식 가능한 입력으로 사용한다.
- 누적 분포 함수 샘플링 기반의 적응형 임계값 설정을 통해 중요도가 높은 토큰을 선택하여, 고정 또는 상위-K 전략보다 우수한 성능을 달성한다.
- 비전 트랜스포머 기반(예: DeiT)에 재주목 블록을 적용하여 정렬 이전에 특징 표현을 정교화한다.
- 이미지 수준의 레이블을 통해 엔드 투 엔드로 훈련하며, 경계 상자 애너테이션 없이 주의 맵을 활용해 경계 상자 예측을 수행한다.
실험 결과
연구 질문
- RQ1재주목 메커니즘이 비전 트랜스포머에서 배경 노이즈를 억제하고 주의 맵을 정교화함으로써 객체 검출 성능을 향상시킬 수 있는가?
- RQ2의미적 가이던스로 클래스 활성화 맵을 통합할 경우, 약한 감독 하의 객체 검출에서 주의 맵 품질에 어떤 영향을 미치는가?
- RQ3누적 중요도 샘플링 기반의 적응형 임계값 설정이 상위-K 또는 고정 임계값 전략보다 토큰 선택에서 더 나은 성능을 내는가?
- RQ4제안된 TRT 프레임워크는 ILSVRC 및 CUB-200-2011와 같은 표준 벤치마크에서 정밀도를 얼마나 향상시키는가?
- RQ5기존 방법에 비해 더 큰 비전 트랜스포머 기반(예: DeiT-B)을 더 효과적으로 활용할 수 있는가?
주요 결과
- TRT는 ILSVRC 벤치마크에서 82.08%의 정밀도를 달성하여 이전 최신 기술을 능가한다.
- CUB-200-2011 데이터셋에서 TRT는 91.1%의 Gt-Known 정밀도를 기록하여 이전 최신 기술인 86.6%보다 뚜렷한 향상을 이룬다.
- 누적 분포 샘플링 기반의 제안된 적응형 임계값 설정 전략은 상위-K 또는 고정 임계값 방법보다 뛰어난 성능을 보였다.
- 절단 실험 결과, TPSM 모듈과 적응형 임계값 설정이 성능 향상에 필수적임을 확인하였으며, 정성적 결과로 더 선명하고 객체 중심의 주의 맵을 관찰할 수 있었다.
- TRT는 DeiT-S보다 더 큰 백본인 DeiT-B에서도 강력한 성능을 유지하였으며, 일부 이전 방법이 DeiT-B에서 DeiT-S보다 성능이 떨어지는 것과는 달리 그러한 문제를 피했다.
- 시각화 결과, TRT는 CAM 기반 또는 표준 트랜스포머 방법보다 더 일관되고 객체에 일치하는 주의 맵을 생성하는 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.