[논문 리뷰] End-to-end Knowledge Retrieval with Multi-modal Queries
이 논문은 이미지와 텍스트 신호를 조합한 다중모odal 쿼리를 사용한 지식 검색을 위한 새로운 벤치마크인 ReMuQ를 소개한다. 또한 중간 모듈(예: 캡션 생성기)을 거치지 않고 원시 이미지와 텍스트를 직접 처리하는 엔드 투 엔드 비전-언어 검색기인 ReViz를 제안하며, 새로운 사전학습 작업인 VL-ICT를 통해 ReMuQ와 OK-VQA에서 제로샷 및 피지테이닝 설정 모두에서 최고 성능을 달성한다.
We investigate knowledge retrieval with multi-modal queries, i.e. queries containing information split across image and text inputs, a challenging task that differs from previous work on cross-modal retrieval. We curate a new dataset called ReMuQ for benchmarking progress on this task. ReMuQ requires a system to retrieve knowledge from a large corpus by integrating contents from both text and image queries. We introduce a retriever model ``ReViz'' that can directly process input text and images to retrieve relevant knowledge in an end-to-end fashion without being dependent on intermediate modules such as object detectors or caption generators. We introduce a new pretraining task that is effective for learning knowledge retrieval with multimodal queries and also improves performance on downstream tasks. We demonstrate superior performance in retrieval on two datasets (ReMuQ and OK-VQA) under zero-shot settings as well as further improvements when finetuned on these datasets.
연구 동기 및 목표
- 이미지와 텍스트에 분산된 정보를 기반으로 대규모 코퍼스에서 관련 지식을 검색하는 데 도전하는 문제를 다루기 위해.
- 기존의 이중단계 검색 방법에서 중간 단계의 이미지-텍스트 모듈(예: 캡션 생성기 또는 물체 검출기)에 의존하는 한계를 극복하기 위해.
- 시각적 및 텍스트 입력을 직접 통합하여 향상된 지식 검색을 위한 엔드 투 엔드 비전-언어 검색기를 개발하기 위해.
- 완전히 애너테이션된 이미지-텍스트 쌍이 필요하지 않은 약한 지도 학습 사전학습 작업인 VL-ICT를 설계하여 다중모달 검색 성능을 향상시키기 위해.
제안 방법
- 원시 이미지 픽셀과 장문의 지식 텍스트를 인코딩하기 위해 ViLT를 사용하는 ReViz를 제안하며, 이는 엔드 투 엔드 학습을 가능하게 한다.
- 텍스트의 关键어를 마스킹하여 정보 泄露를 방지하면서도 이미지와 텍스트 모odal 간의 정렬을 도모하는 새로운 사전학습 작업인 비전-언어 마스킹 대비 튜닝(Vision-Language Masked Contrastive Tuning, VL-ICT)을 도입한다.
- WiT 데이터셋에서 트리플릿을 구성하여 이미지와 텍스트 입력 간 상호 배타성을 확보함으로써 공동 이해를 장려한다.
- 모odal 전용 인코더(비전 트랜스포머 및 언어 트랜스포머)를 사용하는 듀얼 인코더 아키텍처를 채택하고, 대비 학습을 통해 정렬을 학습한다.
- ReMuQ의 지식 소스로 WebQA에서의 답변 옵션 코퍼스를 사용하여 다양한 지식 스펙트럼을 확보한다.
- ReMuQ와 OK-VQA에서 제로샷 및 피지테이닝 평가를 수행하며, 캡션 기반 베이스라인과 강력한 텍스트 전용 모델과의 성능을 비교한다.
실험 결과
연구 질문
- RQ1중간 단계의 캡션 생성 또는 물체 검출에 의존하는 이중단계 방법보다 엔드 투 엔드 비전-언어 검색기가 더 뛰어난 성능을 낼 수 있는가?
- RQ2VL-ICT와 같은 약한 지도 학습 사전학습 작업이 다중모달 쿼리 검색 성능 향상에 얼마나 효과적인가?
- RQ3캡션 생성기와 같은 외부 모듈에 의존성을 제거함으로써 도메인 간 일반화 능력이 향상되는가?
- RQ4VL-ICT 사전학습 작업에서 정보 泄露와 모델 학습 간의 균형을 고려할 때 최적의 마스킹 비율은 무엇인가?
주요 결과
- ReViz는 ReMuQ와 OK-VQA 데이터셋 모두에서 모든 이전 방법보다 제로샷 및 피지테이닝 설정에서 최고 성능을 달성한다.
- VL-ICT 사전학습 작업에서 20% 마스킹 키워드를 사용한 모델이 0% 또는 높은 마스킹 비율보다 더 뛰어난 검색 성능을 보였다.
- 정답 캡션을 사용할 경우 생성된 캡션보다 검색 성능이 크게 향상되었으며, 이는 이전 방법에서 캡션 생성 모델이 성능 저하의 핵심 요인임을 시사한다.
- 아블레이션 연구를 통해 ReViz의 엔드 투 엔드 설계가 중간 모듈로 인한 정보 손실을 방지함으로써 더 견고한 지식 검색을 가능하게 한다는 점을 확인했다.
- ReMuQ 또는 OK-VQA에서 ReViz를 피지테이닝하면 모든 메트릭에서 일관된 성능 향상이 이루어지며, 이는 모델의 적응 가능성과 뛰어난 일반화 능력을 보여준다.
- 제안된 VL-ICT 사전학습 작업은 훈련 데이터가 제한되거나 부분적으로 겹치더라도 하류 검색 성능 향상에 효과적이라는 점을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.