[논문 리뷰] Image Retrieval on Real-life Images with Pre-trained Vision-and-Language Models
이 논문은 36,000개의 실제 생활 이미지-텍스트 쌍으로 구성된 대규모 개방형 도메인 데이터셋인 CIRR를 소개하고, 자연어로 시각적 특징을 조건부로 수정하는 데 사전 훈련된 시각-언어 표현을 활용하는 트랜스포머 기반 모델인 CIRPLANT을 제안한다. CIRPLANT은 개방형 CIRR와 협소 도메인 Fashion-IQ 벤치마크 양쪽에서 최신 기술 수준 성능을 달성하여, 복잡한 실제 환경에서의 미세한 시각적 추론을 위한 시각-언어 사전 훈련의 효과를 입증한다.
We extend the task of composed image retrieval, where an input query consists of an image and short textual description of how to modify the image. Existing methods have only been applied to non-complex images within narrow domains, such as fashion products, thereby limiting the scope of study on in-depth visual reasoning in rich image and language contexts. To address this issue, we collect the Compose Image Retrieval on Real-life images (CIRR) dataset, which consists of over 36,000 pairs of crowd-sourced, open-domain images with human-generated modifying text. To extend current methods to the open-domain, we propose CIRPLANT, a transformer based model that leverages rich pre-trained vision-and-language (V&L) knowledge for modifying visual features conditioned on natural language. Retrieval is then done by nearest neighbor lookup on the modified features. We demonstrate that with a relatively simple architecture, CIRPLANT outperforms existing methods on open-domain images, while matching state-of-the-art accuracy on the existing narrow datasets, such as fashion. Together with the release of CIRR, we believe this work will inspire further research on composed image retrieval.
연구 동기 및 목표
- 기존의 조합적 이미지 검색 데이터셋이 패션 등 협소 도메인에 국한되어 있으며 개방형, 복잡한 실제 생활 이미지를 포함하지 않는 한계를 해결하기 위해.
- 미세한 속성 변화를 감지해야 하는 풍부하고 애매한 시각적 및 언어적 맥락에서의 미세한 시각적 추론을 연구하기 위해.
- 대규모 사전 훈련된 시각-언어 모델을 효과적으로 활용하여 개방형 조합적 이미지 검색을 수행하는 방법을 개발하기 위해.
- 기존 데이터셋에서 흔한 잘못된 음성 결과를 제거하기 위해 완전히 레이블링된 서브셋을 활용한 평가를 가능하게 하기 위해.
- 향후 반복적이고 대화 기반의 이미지 검색 및 미세한 시각언어적 이해에 대한 연구를 자극하기 위해.
제안 방법
- 시각적으로 유사한 이미지 간의 차이를 강조하기 위해 인간이 레이블링한 수정 사항을 포함한 36,000개의 개방형, 실제 생활 이미지-텍스트 쌍으로 구성된 CIRR 데이터셋을 수집한다.
- 이미지와 텍스트 입력을 공동으로 임bedding하기 위해 사전 훈련된 시각-언어 모델(예: OSCAR)을 사용하는 트랜스포머 기반 모델인 CIRPLANT을 제안한다.
- 시각-언어 사전 훈련 모델을 수정하는 텍스트에 따라 이미지 특징을 조건부로 수정하도록 적응시켜, 전반적인 이미지 특징는 유지하면서 교차 어텐션을 통해 텍스트 기반으로 특징를 조정한다.
- 수정된 쿼리 특징와 후보 이미지 특징 간의 ℓ₂-노름 거리로 검색을 수행하는 메트릭 학습 파이프라인을 활용한다.
- 추론 시 모든 쌍에 대한 점수를 계산하는 데 높은 계산 비용이 드는 것을 방지하기 위해, 재귀적이지도, 분류가 아닌 접근 방식을 사용한다.
- 트랜스포머의 자기어텐션을 활용해 수정 텍스트의 개별 단어에 주의를 기울여, 언어적 신호의 미세한 이해를 가능하게 한다.
실험 결과
연구 질문
- RQ1사전 훈련된 시각-언어 모델은 복잡한 시각적·언어적 뉘앙스를 지닌 개방형, 실제 생활 이미지 환경에서 조합적 이미지 검색을 효과적으로 지원할 수 있는가?
- RQ2트랜스포머 아키텍처가 문장 인코딩 모델(예: LSTMs)과 비교해 개별 단어에 주의를 기울일 수 있는 능력이 검색 성능 향상에 기여하는가?
- RQ3시각-언어 사전 훈련 모델의 지식은 사전 훈련 데이터와 다른 도메인에서 조합적 이미지 검색에 얼마나 잘 전이되는가?
- RQ4수정 텍스트가 미세하고 암묵적인 변화를 묘사할 때, 시각적으로 유사한 이미지를 구분하는 데 모델은 어떤 성능을 보이는가?
- RQ5통합된 모델이 개방형과 협소 도메인 양쪽의 조합적 이미지 검색 벤치마크에서 최신 기술 수준 성능을 달성할 수 있는가?
주요 결과
- OSCAR 초기화를 사용한 CIRPLANT는 Fashion-IQ 데이터셋에서 TIRG 및 MAAF와 같은 기존 방법들을 능가하는 최신 기술 수준의 성능을 달성한다.
- CIRR 데이터셋에서 CIRPLANT는 어떤 미세조정 없이도 Recall에서 이전의 모든 최신 기술 수준 방법들을 능가하여 개방형 이미지로의 제로샷 일반화 능력이 뛰어나다는 것을 입증한다.
- 미세한 시각적 추론이 필요한 쿼리 서브셋에서 CIRPLANT는 상당히 높은 Recall을 기록하여 '사람들을 데리고 다니는'과 같은 미세한 언어적 신호를 잘 포착하는 능력을 보여준다.
- CIRPLANT의 성능은 Fashion-IQ에 비해 CIRR에서 뚜렷이 낮아, 실제 생활 이미지의 복잡성과 다양성으로 인한 도메인 이동 문제를 시사한다.
- 정성 분석 결과 CIRPLANT는 희귀한 시각적 개념(예: 아스팔트)과 암묵적 요구사항(예: 개 품종 유지)을 더 잘 포착하는 것으로 나타났지만, 여전히 미세한 속성 유지 작업에서는 실패를 보였다.
- 실패 사례는 개 품종과 같은 특정 속성을 이미지 간에 유지하는 것이 여전히 주요 과제임을 드러내며, 향후 더 향상된 미세한 시각언어 기반 이해가 필요함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.