Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP for All Things Zero-Shot Sketch-Based Image Retrieval, Fine-Grained or Not

Aneeshan Sain, Ayan Kumar Bhunia|arXiv (Cornell University)|2023. 03. 23.
Advanced Image and Video Retrieval Techniques인용 수 5
한 줄 요약

이 논문은 카테고리 수준 및 미세 분류 ZS-SBIR에서 최고 성능을 기록하는 새로운 프롬프트 기반 CLIP 적응 기법을 제안한다. 스케치 전용 시각 프롬프트를 도입하고, 다양한 카테고리 간 스케치-사진 특징 거리의 통일성을 위한 정규화 손실, 그리고 구조적 대응을 위한 패치 셔플링 기법을 적용함으로써, 이전 최고 성능 대비 각각 24.8% 및 26.9% 향상된 정확도를 달성한다.

ABSTRACT

In this paper, we leverage CLIP for zero-shot sketch based image retrieval (ZS-SBIR). We are largely inspired by recent advances on foundation models and the unparalleled generalisation ability they seem to offer, but for the first time tailor it to benefit the sketch community. We put forward novel designs on how best to achieve this synergy, for both the category setting and the fine-grained setting ("all"). At the very core of our solution is a prompt learning setup. First we show just via factoring in sketch-specific prompts, we already have a category-level ZS-SBIR system that overshoots all prior arts, by a large margin (24.8%) - a great testimony on studying the CLIP and ZS-SBIR synergy. Moving onto the fine-grained setup is however trickier, and requires a deeper dive into this synergy. For that, we come up with two specific designs to tackle the fine-grained matching nature of the problem: (i) an additional regularisation loss to ensure the relative separation between sketches and photos is uniform across categories, which is not the case for the gold standard standalone triplet loss, and (ii) a clever patch shuffling technique to help establishing instance-level structural correspondences between sketch-photo pairs. With these designs, we again observe significant performance gains in the region of 26.9% over previous state-of-the-art. The take-home message, if any, is the proposed CLIP and prompt learning paradigm carries great promise in tackling other sketch-related tasks (not limited to ZS-SBIR) where data scarcity remains a great challenge. Project page: https://aneeshan95.github.io/Sketch_LVM/

연구 동기 및 목표

  • 스케치 기반 이미지 검색에서의 데이터 부족 문제를 CLIP의 제로샷 일반화 능력을 활용하여 해결하고자 한다.
  • CLIP를 사용하여 카테고리 수준 및 미세 분류 설정 모두에서 효과적인 제로샷 스케치 기반 이미지 검색을 가능하게 하고자 한다.
  • CLIP의 일반화 능력을 유지하면서도 스케치-사진 정렬에 적응시키기 위한 프롬프트 학습 프레임워크를 설계하고자 한다.
  • 비균일한 특징 거리와 인스턴스 수준의 구조적 대응이 필요한 문제를 해결하기 위해, 미세 분류 ZS-SBIR에서 발생하는 과제들을 극복하고자 한다.
  • 기초 모델인 CLIP가 자원이 적은 스케치 관련 비전 작업에 대해 보다 넓은 잠재력을 지닌다는 것을 입증하고자 한다.

제안 방법

  • 스케치 및 사진 전용의 모odal별 시각 프롬프트를 CLIP의 이미지 인코더에 삽입하고, CLIP 가중치를 동결한 채 트리플릿 손실을 통해 훈련한다.
  • 다양한 카테고리 간 상대적 스케치-사진 거리 분포 간 KL 발산 기반의 새로운 정규화 손실을 적용하여 특징 거리의 균일성을 확보한다.
  • 동일한 순열에 따라 섞인 스케치 및 사진 패치 간의 대응을 인식하도록 훈련하는 패치 셔플링 기법을 제안하여 인스턴스 수준의 구조적 정렬을 가능하게 한다.
  • 추가 성능 향상을 위해 CLIP의 일부 레이어 정규화 파라미터를 미세 조정한다.
  • 텍스트 인코더에 수작업으로 작성된 프롬프트(예: '[카테고리]의 사진')를 사용하여 의미 전달을 향상시키고, word2vec 임베딩을 대체한다.
  • 각 구성 요소의 기여도를 검증하기 위해 추론 분석을 수행하며, 프롬프트 길이 및 프롬프트 학습 대비 수작업 프롬프트의 영향을 평가한다.

실험 결과

연구 질문

  • RQ1프롬프트 학습을 통해 CLIP를 제로샷 스케치 기반 이미지 검색에 효과적으로 적응시킬 수 있으며, 이는 이전 방법보다 우수한 성능을 내는가?
  • RQ2CLIP의 일반화 능력을 활용하여 ZS-SBIR에서 카테고리 간 의미 전달을 향상시킬 수 있는가?
  • RQ3카테고리 수준 ZS-SBIR에서 나타나지 않는, 미세 분류 ZS-SBIR에서 발생하는 과제는 무엇이며, 이를 어떻게 해결할 수 있는가?
  • RQ4이 제로샷 스케치 검색 환경에서 프롬프트를 학습하는 것이 수작업 프롬프트보다 성능을 향상시키는가?
  • RQ5세부 사양 모델링 측면에서 스케치 기반 검색은 키워드 기반 검색보다 어떻게 다를까?

주요 결과

  • 제안된 방법은 카테고리 수준 ZS-SBIR에서 Sketchy 데이터셋의 mAP@all 기준으로 이전 SOTA 대비 24.8% 상대적 향상을 기록하며, 이를 초월한다.
  • 미세 분류 ZS-SBIR에서, Sketchy 데이터셋에서 Top-1 정확도 기준으로 26.9% 상대적 향상을 기록하여 새로운 SOTA를 수립한다.
  • f-분산 정규화 손실(Lδ)을 제거할 경우 FG-ZS-SBIR에서 Top-1 정확도가 3.75% 감소하여, 카테고리 간 특징 거리 균일성을 유지하는 데 이 손실의 중요성을 확인한다.
  • 패치 셔플링 손실(LPS)은 FG-ZS-SBIR에서 Top-1 정확도에 3.15% 기여하여, 구조적 대응을 학습하는 데 효과적임을 입증한다.
  • CLIP의 텍스트 인코더에 수작업 프롬프트를 사용할 경우 word2vec 임베딩보다 Top-1 정확도가 4.57% 높게 나타나, 시각-언어 사전 훈련의 가치를 입증한다.
  • 수작업 프롬프트 대신 프롬프트를 학습할 경우 Top-1 정확도가 2.36% 감소하여, 이 맥락에서 수작업 자연어 프롬프트가 더 잘 일반화됨을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.