Skip to main content
QUICK REVIEW

[논문 리뷰] Chatting Makes Perfect: Chat-based Image Retrieval

Matan Levy, Rami Ben‐Ari|arXiv (Cornell University)|2023. 05. 31.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 대화를 통해 사용자와의 상호작용을 반복적으로 진행하여 검색 의도를 다듬는 대화 기반 이미지 검색 시스템인 ChatIR을 소개한다. 대화 5라운드 후 5만 장의 이미지 데이터셋에서 78%의 검색 정확도를 달성하며, 단일 쿼리 기반 텍스트-이미지 검색(64%)과 인간이 질문하는 대화 방식(75%)을 뛰어넘는 성능을 보였다. Foundation 모델과 BLIP2를 합성 답변자로 사용하는 새로운 평가 파이프라인을 통해 달성했다.

ABSTRACT

Chats emerge as an effective user-friendly approach for information retrieval, and are successfully employed in many domains, such as customer service, healthcare, and finance. However, existing image retrieval approaches typically address the case of a single query-to-image round, and the use of chats for image retrieval has been mostly overlooked. In this work, we introduce ChatIR: a chat-based image retrieval system that engages in a conversation with the user to elicit information, in addition to an initial query, in order to clarify the user's search intent. Motivated by the capabilities of today's foundation models, we leverage Large Language Models to generate follow-up questions to an initial image description. These questions form a dialog with the user in order to retrieve the desired image from a large corpus. In this study, we explore the capabilities of such a system tested on a large dataset and reveal that engaging in a dialog yields significant gains in image retrieval. We start by building an evaluation pipeline from an existing manually generated dataset and explore different modules and training strategies for ChatIR. Our comparison includes strong baselines derived from related applications trained with Reinforcement Learning. Our system is capable of retrieving the target image from a pool of 50K images with over 78% success rate after 5 dialogue rounds, compared to 75% when questions are asked by humans, and 64% for a single shot text-to-image retrieval. Extensive evaluations reveal the strong capabilities and examine the limitations of CharIR under different settings. Project repository is available at https://github.com/levymsn/ChatIR.

연구 동기 및 목표

  • 의도가 모호하거나 불완전한 기술적 기술로 인해 결과가 열악해지는 단일 쿼리 기반 텍스트-이미지 검색의 한계를 해결하기 위해.
  • 정적 쿼리 대신 대화 기반 검색이 이미지 검색에서 더 자연스럽고 효과적인 대안이 될 수 있는지 탐색하기 위해.
  • BLIP2를 활용해 합성 인간 유사 답변을 생성함으로써 대화 기반 이미지 검색을 위한 확장 가능한 평가 프레임워크를 개발하기 위해.
  • 대화 동역학, 질문 품질, 모델 훈련 전략이 검색 성능에 미치는 영향을 조사하기 위해.

제안 방법

  • 시스템은 두 단계 아키텍처를 사용한다: 대화 기록에서 이미지를 검색하는 이미지 검색(IS) 모듈과, 다음 질문을 생성하는 대화 구축(DB) 모듈.
  • 이미지 검색 모델 $F$ 는 대화 시퀀스를 시각적 임베딩 공간으로 매핑하는 텍스트 인코더이며, 다양한 마스킹 전략을 사용해 훈련된다.
  • 대화 구축 모듈 $G$ 는 지시 미세조정된 LLM 기반 질문 생성기로, 전체 대화 기록을 바탕으로 맥락 인식형 다음 질문을 생성한다.
  • 평가 중에는 실제 인간의 응답을 시뮬레이션하기 위해 합성 답변자(BLIP2)를 사용하여 인간이 참여하지 않는 환경에서도 확장 가능한 벤치마킹이 가능해진다.
  • 시스템은 VisDial 데이터셋을 활용하여 평가되며, 각 이미지가 대상이고 대화가 검색 쿼리가 되도록 재사용된다.
  • 검색 성능는 각 대화 라운드에서 목표 이미지를 성공적으로 검색할 확률을 평균 목표 순위(ATR) 및 성공률 지표로 측정한다.

실험 결과

연구 질문

  • RQ1반복적 대화 기반 상호작용은 단일 쿼리 기반 텍스트-이미지 검색에 비해 이미지 검색 성능을 어떻게 향상시키는가?
  • RQ2대화 환경에서 검색 모델($F$)을 훈련할 때 어떤 마스킹 전략이 가장 높은 성능을 낳는가?
  • RQ3다양한 질문 생성 모델($G$)은 검색 성공에 어떤 영향을 미치며, LLM은 인간 수준의 질문 품질을 충족할 수 있는가?
  • RQ4BLIP2와 같은 비전-언어 모델이 대화 기반 검색 시스템 평가에서 인간 답변자와 얼마나 유사하게 기능할 수 있는가?
  • RQ5현재 대화 기반 검색 시스템의 한계는 무엇이며, 특히 다양한 정보를 담은 새로운 질문을 생성하는 데서 어떤 문제가 있는가?

주요 결과

  • ChatIR은 다섯 번의 대화 라운드 후 5만 장의 이미지 풀에서 목표 이미지를 78%의 성공률로 검색했으며, 단일 쿼리 기반 텍스트-이미지 검색(64%)을 뛰어나고 인간 질문 기반 대화 방식(75%)과도 유사한 성능을 보였다.
  • 검색 모델($F$) 훈련 시 초기 이미지 캡션을 마스킹하는 것이 가장 높은 성능을 내며, 모든 질문 생성 유형에서 정확도가 2–3% 향상된다.
  • 인간과 ChatGPT 질문자 모두 대화 라운드가 진행될수록 검색 순위가 지속적으로 향상되나, 강화학습 기반 방법과 풀 기반 질문자들은 초기 단계 이후 성능 향상이 없어진다.
  • BLIP2를 합성 답변자로 사용하면 인간 응답의 성능 추세와 유사하게 유연하고 확장 가능한 대체 수단이 되며, 신뢰할 수 있는 성능을 보인다.
  • 강화학습 기반 질문자($RL_{17}$ 및 $RL_{19}$)는 성능이 열악하며, 특히 자신들의 답변자와 조합했을 때는 시간이 지남에 따라 검색 순위 향상이 전혀 없다.
  • 다수의 모델이 성능 향상이 없는 이유는 새로운, 구별 가능한 질문을 생성하지 못해 반복적이거나 정보가 없는 대화가 되기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.