[논문 리뷰] CaFT: Clustering and Filter on Tokens of Transformer for Weakly Supervised Object Localization
CaFT는 시각 트랜스포머(ViT)를 사용하여 패치 토큰을 클러스터링하고 경량 Attention Filter(AtF) 헤드를 적용하여 수동으로 설정한 임계값 없이 정확한 객체 마스크를 생성하는 새로운 약한 지도 학습 객체 국소화 방법을 제안한다. 지도 학습된 클래스 레이블을 사용할 때 CUB-200과 ImageNet-1K에서 각각 97.55%와 69.86%의 국소화 정확도를 달성하며, 이는 분류 기반 활성화 맵 기반 기존 방법보다 분류 영역 의존성과 임계값 선택에 대한 의존도를 제거함으로써 우수한 성능을 발휘한다.
Weakly supervised object localization (WSOL) is a challenging task to localize the object by only category labels. However, there is contradiction between classification and localization because accurate classification network tends to pay attention to discriminative region of objects rather than the entirety. We propose this discrimination is caused by handcraft threshold choosing in CAM-based methods. Therefore, we propose Clustering and Filter of Tokens (CaFT) with Vision Transformer (ViT) backbone to solve this problem in another way. CaFT first sends the patch tokens of the image split to ViT and cluster the output tokens to generate initial mask of the object. Secondly, CaFT considers the initial mask as pseudo labels to train a shallow convolution head (Attention Filter, AtF) following backbone to directly extract the mask from tokens. Then, CaFT splits the image into parts, outputs masks respectively and merges them into one refined mask. Finally, a new AtF is trained on the refined masks and used to predict the box of object. Experiments verify that CaFT outperforms previous work and achieves 97.55\% and 69.86\% localization accuracy with ground-truth class on CUB-200 and ImageNet-1K respectively. CaFT provides a fresh way to think about the WSOL task.
연구 동기 및 목표
- 수동으로 설정한 임계값에 의존하는 기존 CAM 기반 방법이 분류 영역에 집중할 뿐 아니라 전체 객체에 대한 국소화가 어려운 점을 해결하기 위해.
- 활성화 맵 기반 국소화에서 수동 임계값 선택이 필요 없도록 하기 위해.
- 시각 트랜스포머의 클래스 토큰을 활용하여 클러스터 기반 마스크 생성을 통해 국소화 정확도를 향상시키기 위해.
- 초기 마스크를 클러스터링 결과로 얻은 후 보정하기 위한 경량의 편두성 헤드(AtF)를 개발하여 강력한 객체 국소화를 달성하기 위해.
- 클러스터링과 ViT 특징 기반 딥 러닝을 융합하여 WSOL의 새로운 패러다임을 제안하기 위해.
제안 방법
- 클러스터링을 통해 ViT 처리된 패치 토큰의 특징 벡터를 군집화하고, 클래스 토큰을 포함한 클러스터를 전경 객체 마스크로 선정한다.
- 초기 클러스터 마스크를 편두성 레이블로 사용하여 경량 Attention Filter(AtF) 헤드를 학습시켜 ViT 토큰에서 유도된 마스크를 보정한다.
- 이미지를 여러 부분으로 분할하고 각 부분을 독립적으로 처리하여 국소 마스크를 생성한 후, 이를 융합하여 정교화된 전역 마스크를 생성한다.
- 정교화된 마스크를 기반으로 두 번째 AtF 헤드를 학습시켜 최종 객체 바운딩 박스를 예측한다.
- 클러스터링 및 AtF 수행 이전에 마지막 세 개의 ViT 레이어에서의 특징 맵과 그들의 위치 임bedding을 융합하여 표현 품질을 향상시킨다.
- AtF 모듈은 배치 정규화와 활성화 함수를 적용한 1×1 또는 3×3 컨벌루션을 사용하여 토큰 수준의 특징에서 전경-배경 구분을 학습한다.
실험 결과
연구 질문
- RQ1클래스 토큰을 안내로 사용한 ViT 패치 토큰 클러스터링이 임계값 설정 없이 초기 객체 마스크를 효과적으로 생성할 수 있는가?
- RQ2클러스터링으로 생성된 편두성 마스크를 기반으로 학습된 경량 Attention Filter(AtF) 헤드가 직접 회귀나 분류를 수행하는 것보다 국소화 정확도를 향상시키는가?
- RQ3여러 레이어에서의 ViT 특징 다중 척도 융합이 클러스터링 및 마스크 생성 성능에 어떤 영향을 미치는가?
- RQ4과적합을 방지하고 가장자리 검출 성능을 향상시키기 위해 AtF 헤드의 최적 아키텍처는 커널 크기와 깊이 측면에서 어떤가?
- RQ5클러스터링에서 유도된 편두성 레이블이 강력한 국소화 헤드를 학습하는 데 효과적으로 사용될 수 있는가? 이는 바운딩 박스 회귀와 비교해 볼 때 어떤가?
주요 결과
- CaFT는 지도 학습된 클래스 레이블을 사용할 때 CUB-200에서 97.55%의 국소화 정확도를 달성하며, 이는 기존 CAM 기반 방법보다 뚜렷하게 뛰어난 성능을 발휘한다.
- ImageNet-1K에서는 지도 학습된 클래스 레이블을 사용할 때 69.86%의 국소화 정확도를 기록하며, 대규모 데이터에서 뛰어난 일반화 능력을 입증한다.
- 클러스터링으로 생성된 편두성 마스크를 기반으로 학습된 AtF 헤드는 동일한 편두성 레이블을 사용하더라도 바운딩 박스 회귀 헤드보다 더 뛰어난 안정성과 노이즈 필터링 성능을 보이며 성능이 뛰어나다.
- 1×1 컨벌루션을 사용한 AtF(AtFS)가 가장 높은 성능과 일반화 능력을 보이며, 3×3 커널은 과적합을 유발하고 가장자리 검출 성능을 떨어뜨린다.
- 마지막 세 개의 ViT 레이어에서의 특징 융합은 마스크 품질을 향상시키며, 위치 임베딩을 추가로 포함하면 성능이 0.05% 향상된다.
- 편두성 마스크에 대해 딥 네트워크(ResNet50, VGG16)를 직접 학습시키면 과적합이 발생하고 클러스터링만으로도 성능이 떨어지므로, AtF와 같은 경량이고 작업에 특화된 헤드가 필요함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.