[논문 리뷰] MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text
MuRAG는 외부 비매개변수 메모리에서 이미지와 텍스트 양측을 검색하고 추론함으로써 개방형 질의응답을 향상시키는 최초의 다중모달 검색 보강 생성자이다. 대비 및 생성 손실을 사용하여 이미지-텍스트 및 텍스트 전용 데이터 코퍼스의 혼합체로 사전 훈련된 MuRAG는 WebQA 및 MultimodalQA에서 기존 모델보다 절대 정확도 10–20% 향상되어 최신 기술 수준을 달성한다.
While language Models store a massive amount of world knowledge implicitly in their parameters, even very large models often fail to encode information about rare entities and events, while incurring huge computational costs. Recently, retrieval-augmented models, such as REALM, RAG, and RETRO, have incorporated world knowledge into language generation by leveraging an external non-parametric index and have demonstrated impressive performance with constrained model sizes. However, these methods are restricted to retrieving only textual knowledge, neglecting the ubiquitous amount of knowledge in other modalities like images -- much of which contains information not covered by any text. To address this limitation, we propose the first Multimodal Retrieval-Augmented Transformer (MuRAG), which accesses an external non-parametric multimodal memory to augment language generation. MuRAG is pre-trained with a mixture of large-scale image-text and text-only corpora using a joint contrastive and generative loss. We perform experiments on two different datasets that require retrieving and reasoning over both images and text to answer a given query: WebQA, and MultimodalQA. Our results show that MuRAG achieves state-of-the-art accuracy, outperforming existing models by 10-20\% absolute on both datasets and under both distractor and full-wiki settings.
연구 동기 및 목표
- 기존 검색 보강 언어 모델이 텍스트에만 의존하여 이미지에만 포함된 지식에 접근할 수 없는 한계를 해결하기 위해.
- 대규모 코퍼스에서 이미지와 텍스트의 다중모달 지식을 기반으로 통합된 프레임워크를 개발하여 검색 보강 언어 생성을 가능하게 하기 위해.
- 외부 메모리에서 검색한 시각적 및 텍스트적 증거에 기반하여 답변을 정립함으로써 사실 기반 개방형 질문 응답을 향상시키기 위해.
- 다양한 이미지-텍스트 및 텍스트 전용 데이터셋에서 연합 대비 및 생성 목표를 사용하여 다중모달 모델을 사전 훈련함으로써 검색 및 생성 능력을 향상시키기 위해.
제안 방법
- MuRAG는 사전 훈련된 T5 인코더와 ViT 인코더를 결합하여 이미지-텍스트 쌍, 이미지 전용, 텍스트 전용 입력을 공통의 다중모달 표현 공간에 함께 임bedding한다.
- 모델은 두 단계 훈련 파이프라인을 사용한다: 먼저 효율적인 사전 훈련을 위해 작은 배치 내 메모리로 훈련하고, 이후 큰 정적 인코딩 및 색인화된 글로벌 메모리로 미세조정한다.
- 사전 훈련 기간 동안, 모델은 관련된 메모리 항목과 관련이 없는 항목을 구분하기 위한 대비 손실과 검색된 지식을 사용하여 정확한 답변을 생성하기 위한 생성 손실로 훈련된다.
- 추론 기간 동안, 모델은 질의 임베딩을 사용하여 외부 메모리에서 관련된 이미지-텍스트 쌍을 검색한 후, 질의와 함께 검색된 다중모달 증거에 기반하여 답변을 생성한다.
- 검색 과정은 미분 가능하고 엔드 투 엔드로 훈련 가능하여 생성자와 검색기를 함께 최적화할 수 있다.
- 모델은 동일한 대비 및 생성 손실을 사용하여 최종 QA 데이터셋에서 미세조정되며, 입력은 질문과 캡션이 달린 이미지 및 텍스트 스니펫의 메모리로 구성된다.
실험 결과
연구 질문
- RQ1검색 보강 언어 모델이 다중모달 지식(이미지 및 텍스트)을 효과적으로 검색하고 추론하여 개방형 질의응답을 향상시킬 수 있는가?
- RQ2다중모달 검색 보강 생성이 텍스트 전용 검색 보강 모델에 비해 다중모달 QA 벤치마크에서 정확도 측면에서 어떻게 비교되는가?
- RQ3사전 훈련에서 성능 향상에 가장 크게 기여하는 핵심 구성 요소는 무엇인가?
- RQ4왜 이미지 기반 질의는 텍스트 기반 질의보다 훨씬 어려운가? 그리고 시각적 이해에서 주요 실패 유형은 무엇인가?
주요 결과
- MuRAG는 WebQA 및 MultimodalQA 양 측면에서 최신 기술 수준의 성능을 달성하였으며, 배경잡음 설정과 전체 위키 설정 모두에서 기존 베이스라인보다 절대 정확도 10–20% 향상되었다.
- WebQA 데이터셋에서 MuRAG는 배경잡음 설정에서 텍스트 질의로 80%의 정확도, 이미지 질의로 64%의 정확도를 기록하였으며, 전체 위키 설정에서는 각각 72%와 54%의 정확도를 기록하였다.
- 이미지 기반 질의는 텍스트 기반 질의보다 훨씬 어려운데, 주요 실패 유형은 수량 세기 실수(52%)와 물체 인식 오류(29.4%)였다.
- 모델은 단순 학습을 보이며, 때로는 잘못된 이미지를 검색해도 텍스트적 단서에 기반해 정확한 답변을 생성함으로써, 시각적 기반보다 텍스트 신호에 더 의존하고 있음을 보여주었다.
- 시각적 이해 모듈은 여전히 한계점으로 남아 있으며, 특히 복잡한 장면, 희귀 물체, 또는 이미지에서 문자 인식이 필요한 질문에서 문제가 된다.
- LAION과 같은 대규모 사전 훈련 데이터를 사용함에도 불구하고, 모델은 여전히 편향을 유전하고 있다—예를 들어 오류의 5%는 성별 오인식 때문이며, 이는 다중모달 모델에서 보다 나은 편향 제거가 필요함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.