[논문 리뷰] Adapting CLIP For Phrase Localization Without Further Training
이 논문은 인간에 의해 애너테이션된 바운딩 박스나 파인튜닝 없이도 CLIP를 고밀도 시각적 기반에 적응시키는 제로샷 문구 로컬라이제이션 방법을 제안한다. ViT와 ResNet 버전의 CLIP에서 고해상도 공간 특징 맵을 추출함으로써, 텍스트 쿼리와 이미지 특징 간의 픽셀 단위 유사도를 계산하여 로컬라이제이션 히트맵을 생성한다. 이는 제로샷 설정에서 Flickr30k와 Visual Genome에서 최신 기술 수준의 성능을 달성하며, 이전의 훈련 없이 적용하는 방법들보다 최대 5%p의 절대적 성능 향상을 보였다.
Supervised or weakly supervised methods for phrase localization (textual grounding) either rely on human annotations or some other supervised models, e.g., object detectors. Obtaining these annotations is labor-intensive and may be difficult to scale in practice. We propose to leverage recent advances in contrastive language-vision models, CLIP, pre-trained on image and caption pairs collected from the internet. In its original form, CLIP only outputs an image-level embedding without any spatial resolution. We adapt CLIP to generate high-resolution spatial feature maps. Importantly, we can extract feature maps from both ViT and ResNet CLIP model while maintaining the semantic properties of an image embedding. This provides a natural framework for phrase localization. Our method for phrase localization requires no human annotations or additional training. Extensive experiments show that our method outperforms existing no-training methods in zero-shot phrase localization, and in some cases, it even outperforms supervised methods. Code is available at https://github.com/pals-ttic/adapting-CLIP .
연구 동기 및 목표
- 인간 애너테이션 기반의 문구 로컬라이제이션 데이터셋의 높은 비용과 확장성의 한계를 해결하기 위해.
- 객체 검출기나 카테고리 편향이 있는 다른 사전 훈련된 모델에 의존하지 않기 위해.
- 추가적인 훈련 없이도 사전 훈련된 CLIP 모델만을 사용하여 제로샷 문구 로컬라이제이션을 가능하게 하기 위해.
- 오픈 뷰포인트, 희귀 및 알려지지 않은 객체 카테고리에 모두 일반화 가능한 방법을 개발하기 위해.
제안 방법
- 모델의 순전파를 수정하여 ViT 및 ResNet 아키텍처 양쪽에서 공간 정보를 유지하는 고해상도 공간 특징 맵을 생성함으로써 CLIP을 고밀도 시각적 기반에 적응시킨다.
- 입력된 문구를 CLIP의 텍스트 인코더를 사용해 이미지 특징와 동일한 의미 공간에 임bedding한다.
- 텍스트 임베딩과 각 공간 특징 맵 간의 픽셀 단위 코사인 유사도를 계산하여 점수 히트맵을 생성한다.
- 히트맵에서 최고 점수를 가진 바운딩 박스를 추출하기 위해 비최대 억제 유사 절차를 적용한다.
- 특징 맵의 공간 해상도를 향상시키기 위해 업샘플링 기법을 활용하여 정밀도를 향상시킨다.
- 기본적으로 사전 훈련된 CLIP 모델의 제로샷 일반화 능력을 활용하며, 기반 학습 데이터에 대한 파인튜닝 없이도 작동한다.
실험 결과
연구 질문
- RQ1CLIP는 추가적인 훈련이나 애너테이션 없이도 고밀도 시각적 기반을 수행할 수 있는가?
- RQ2모델이 기반 애너테이션을 본 적이 없는 상황에서 CLIP의 제로샷 능력이 문구 로컬라이제이션에 얼마나 효과적인가?
- RQ3CLIP의 백본(비트 vs. ResNet) 선택과 특징 해상도가 로컬라이제이션 성능에 영향을 미치는가?
- RQ4사전 훈련된 객체 검출기에 의존하는 방법들과 비교해 볼 때, 이 방법은 희귀 또는 알려지지 않은 객체 카테고리에서 어떻게 성능을 내는가?
주요 결과
- Flickr30k와 Visual Genome에서 세 가지 이상의 제로샷 분할 설정에서 기존의 훈련 없이 적용하는 방법들보다 최대 5%p의 절대적 성능 향상을 보였다.
- Flickr-All 분할에서 평균 IoU가 43.80%를 기록하여 동일한 제로샷 설정에서 ZSGNet의 38.31%보다 뚜렷이 높은 성능을 보였다.
- ViT-L/14 모델은 Flickr-S0에서 40.37%의 IoU, Flickr-S1에서 36.10%의 IoU를 기록하여 알려지지 않은 문구와 카테고리에 대한 강력한 일반화 능력을 입증했다.
- 더 높은 해상도의 특징 맵(2배 업샘플링)은 모든 모델과 데이터셋에서 일관되게 성능 향상을 가져왔으며, 일부 분할에서는 최대 2.5%p의 성능 향상이 있었다.
- 사전 훈련된 객체 검출기에 의존하는 방법들과 비교해 볼 때, 이 방법은 긴 꼬리 분포 및 희귀 객체 카테고리에 더 잘 일반화되어 카테고리 편향을 줄였다.
- 절단 실험 결과, 더 큰 CLIP 모델과 더 세밀한 공간 해상도가 더 나은 로컬라이제이션 성능을 내며, ViT-B/16 및 ViT-L/14가 ResNet 기반 변종보다 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.