Skip to main content
QUICK REVIEW

[논문 리뷰] Vision-by-Language for Training-Free Compositional Image Retrieval

Shyamgopal Karthik, Karsten Roth|arXiv (Cornell University)|2023. 10. 13.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 시각-언어 모델(VLM)을 사용해 이미지 캡션을 생성하고, 대규모 언어 모델(LLM)을 활용해 텍스트 수정 사항에 대한 추론을 수행하는, 훈련 없이 작동하는 제로샷 복합 이미지 검색 방법인 CIReVL을 제안한다. 이미지 이해, 언어 기반 추론, 다중모달 검색을 분리함으로써 CIReVL은 CIRCO에서 mAP@5 기준 최신 기술을 2.5배 이상 뛰어넘고, CIRR에서 R@1=34.64%의 성능을 달성한다. 이는 인간이 이해하고 후행 조작이 가능한 모듈형 언어 기반 파이프라인 구성 요소를 통해 실현된다.

ABSTRACT

Given an image and a target modification (e.g an image of the Eiffel tower and the text "without people and at night-time"), Compositional Image Retrieval (CIR) aims to retrieve the relevant target image in a database. While supervised approaches rely on annotating triplets that is costly (i.e. query image, textual modification, and target image), recent research sidesteps this need by using large-scale vision-language models (VLMs), performing Zero-Shot CIR (ZS-CIR). However, state-of-the-art approaches in ZS-CIR still require training task-specific, customized models over large amounts of image-text pairs. In this work, we propose to tackle CIR in a training-free manner via our Compositional Image Retrieval through Vision-by-Language (CIReVL), a simple, yet human-understandable and scalable pipeline that effectively recombines large-scale VLMs with large language models (LLMs). By captioning the reference image using a pre-trained generative VLM and asking a LLM to recompose the caption based on the textual target modification for subsequent retrieval via e.g. CLIP, we achieve modular language reasoning. In four ZS-CIR benchmarks, we find competitive, in-part state-of-the-art performance - improving over supervised methods. Moreover, the modularity of CIReVL offers simple scalability without re-training, allowing us to both investigate scaling laws and bottlenecks for ZS-CIR while easily scaling up to in parts more than double of previously reported results. Finally, we show that CIReVL makes CIR human-understandable by composing image and text in a modular fashion in the language domain, thereby making it intervenable, allowing to post-hoc re-align failure cases. Code will be released upon acceptance.

연구 동기 및 목표

  • 훈련이 필요 없는 제로샷 검색을 가능하게 하여 감독 학습 기반 복합 이미지 검색(CIR)의 높은 주석 비용 문제를 해결하기 위해.
  • 주로 언어 영역에서 작동함으로써 CIR의 해석 가능성과 사용자 간섭 능력을 향상시키기 위해.
  • 재훈련 없이도 제로샷 CIR에서의 스케일링 법칙을 탐색하기 위해.
  • 특화된 사전 미세조정 모델 대비 공급된 모델이 경쟁력 있거나 뛰어난 성능을 낼 수 있음을 입증하기 위해.
  • 모든 파이프라인 단계에서 인간의 간섭을 통해 검색 실패를 후행적으로 수정할 수 있도록 하기 위해.

제안 방법

  • 기존에 훈련된 시각-언어 모델(예: BLIP-2 또는 CoCa)을 사용해 기준 이미지의 세부적인 캡션을 생성한다.
  • 생성된 캡션과 텍스트 수정 사항(예: '사람 없이 야간에')을 대규모 언어 모델(LLM)에 입력하여 원하는 수정된 이미지를 묘사하는 타겟 캡션을 생성한다.
  • LLM이 생성한 캡션을 기반으로 사전 훈련된 CLIP 모델을 사용해 데이터베이스 내에서 가장 유사한 이미지를 검색한다.
  • 검색 파이프라인을 세 가지 모듈형 단계로 분리한다: 캡션 생성, 언어 기반 추론, 다중모달 검색.
  • 재훈련 없이도 어떤 단계에서든 캡션 또는 지시어를 수동으로 수정할 수 있도록 사용자 간섭을 가능하게 한다.
  • 전체 시스템을 재훈련하지 않고도 검색 모델을 간단히 교체함으로써 성능을 확장할 수 있다(예: CLIP-B/16에서 ViT-g/14로).

실험 결과

연구 질문

  • RQ1공급된 모델을 사용하는 훈련 없이도 모듈형 파이프라인으로 경쟁적 또는 뛰어난 성능을 내는가?
  • RQ2LLM 단계에서의 언어 수준 추론이 검색 정확도와 일반화 능력에 얼마나 기여하는가?
  • RQ3재훈련 없이도 검색 모델의 능력 증가에 따른 스케일링 법칙은 어떻게 영향을 미치는가?
  • RQ4모듈형 언어 기반 설계가 인간의 해석 가능성과 후행 조작을 통해 검색 실패를 수정할 수 있도록 하는가?
  • RQ5이 방법은 도메인 변환 및 조건부 유사도 작업을 포함한 다양한 CIR 벤치마크에 일반화되는가?

주요 결과

  • CIReVL은 CIRR 벤치마크에서 R@1=34.64%를 달성하여 이전 최신 기술인 SEARLE의 24.55%보다 뚜렷이 뛰어나다.
  • CIRCO 벤치마크에서 CIReVL은 mAP@5=26.77%를 기록하여 이전에 보고된 최고 기록인 11.68%를 두 배 이상 초월한다.
  • 더 큰 모델을 사용할수록 성능 향상이 뚜렷하게 나타나며, 검색 모델의 능력과 성능 간에 명확한 로그선형 스케일링 관계를 보인다.
  • 실패 사례는 언어 기반 파이프라인 덕분에 쉽게 진단되고 수정 가능하여 캡션 또는 지시어 단계에서 효과적인 인간 간섭이 가능하다.
  • 제거 분석 결과, 텍스트 쿼리에 대한 언어 수준 추론이 핵심이며, 캡션 생성 및 검색 구성 요소도 전체 성능에 크게 기여한다.
  • 모듈형, 훈련 없이도 구성 요소를 쉽게 확장하거나 교체할 수 있으며, 예를 들어 CLIP-B/16에서 ViT-g/14로 교체하는 것만으로도 재훈련 없이도 성능 향상을 이룰 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.