[논문 리뷰] REVEAL: Retrieval-Augmented Visual-Language Pre-Training with Multi-Source Multimodal Knowledge Memory
ReVeaL은 다양한 소스—예를 들어 이미지-텍스트 쌍, 지식 그래프, 위키백과 문단—에서 유일한 다중모odal 메모리를 사전 훈련하여 효율적인 검색과 생성을 가능하게 하는 엔드 투 엔드 검색 보강형 시각-언어 모델을 제안한다. 주어진 질의에 대해 검색기와 생성기를 함께 훈련시키며 주의 기반 융합 메커니즘을 사용함으로써 ReVeaL은 기존 방법보다 훨씬 적은 파라미터로 OKVQA에서 최고 성능(59.1% 정확도)을 달성한다.
In this paper, we propose an end-to-end Retrieval-Augmented Visual Language Model (REVEAL) that learns to encode world knowledge into a large-scale memory, and to retrieve from it to answer knowledge-intensive queries. REVEAL consists of four key components: the memory, the encoder, the retriever and the generator. The large-scale memory encodes various sources of multimodal world knowledge (e.g. image-text pairs, question answering pairs, knowledge graph triplets, etc) via a unified encoder. The retriever finds the most relevant knowledge entries in the memory, and the generator fuses the retrieved knowledge with the input query to produce the output. A key novelty in our approach is that the memory, encoder, retriever and generator are all pre-trained end-to-end on a massive amount of data. Furthermore, our approach can use a diverse set of multimodal knowledge sources, which is shown to result in significant gains. We show that REVEAL achieves state-of-the-art results on visual question answering and image captioning.
연구 동기 및 목표
- 세계 지식이 업데이트될 때마다 막대한 재훈련이 필요한 대규모 시각-언어 모델의 한계를 해결하기 위해.
- 모델 파라미터에서 지식 저장을 분리함으로써 효율적이고 확장 가능하며 동적 지식 검색을 가능하게 하기 위해.
- 다양한 다중모달 지식 소스를 활용하여 지식 집약적 시각-언어 작업의 성능을 향상시키기 위해.
- 검색기와 생성기를 공동 최적화하는 유연한 엔드 투 엔드 훈련 철학을 개발하기 위해.
- 모델 파라미터를 재훈련하지 않고 외부 메모리만 수정함으로써 빠른 지식 업데이트를 가능하게 하기 위해.
제안 방법
- 모델은 다중모달 지식 소스—이미지-텍스트 쌍, 위키백과 문단, 지식 그래프 트리플릿—을 동일한 메모리 공간에 통합하기 위해 유일한 인코더를 사용한다.
- 검색기 모듈은 다중모달 질의 임베딩을 사용하여 주의 기반 융합 메커니즘을 통해 메모리에서 가장 관련성이 높은 지식 항목을 검색한다.
- 주의 기반 융합 레이어는 검색 점수를 직접 자기주의 기반 메커니즘에 통합하여 검색기의 역전파를 엔드 투 엔드로 가능하게 한다.
- 생성기는 검색된 지식과 입력 질의를 융합하여 답변 또는 캡션을 생성하며, 언어 모델링 목표로 훈련된다.
- 메모리, 인코더, 검색기, 생성기로 구성된 전체 시스템은 다수의 지식 소스를 포함한 대규모 이미지-텍스트 코퍼스에서 공동으로 사전 훈련된다.
- 지식 업데이트는 모델 파라미터를 재훈련하지 않고 메모리만 수정함으로써 가능해지며, 이는 동적 적응을 가능하게 한다.

실험 결과
연구 질문
- RQ1검색 보강형 시각-언어 모델이 지식 집약적 시각 질의 응답 및 이미지 캡션 생성 작업에서 최고 성능을 달성할 수 있는가?
- RQ2검색기와 생성기를 함께 사전 훈련함으로써, 고정된 또는 디스틸레이션 기반 방법보다 더 나은 검색 및 생성 성능를 달성할 수 있는가?
- RQ3통합된 다중모달 메모리는 다양한 지식 소스(예: 텍스트, 이미지, 지식 그래프)를 효과적으로 통합하여 추론 성능를 향상시킬 수 있는가?
- RQ4모델 파라미터를 재훈련하지 않고도 새로운 또는 업데이트된 지식에 얼마나 효율적으로 적응할 수 있는가?
- RQ5독립적인 검색 점수 기반 방법과 비교해 볼 때, 주의 기반 융합 메커니즘이 검색 품질과 최종 작업 정확도를 향상시키는가?
주요 결과
- ReVeaL은 OKVQA 벤치마크에서 59.1%의 정확도로 새로운 최고 성능을 달성하여 이전 방법들을 크게 앞서간다.
- 이전 최고 성능 방법들보다 파라미터 수가 약 10배 적은 수준으로도 이 성능를 달성함으로써 높은 파라미터 효율성을 입증한다.
- 주의 기반 융합 방법은 WIT 데이터셋에서 상위 10개 검색 결과 기준 72.6%의 검색 정확도, 상위 100개 기준 89.4%의 정확도를 기록하며, Attention Distill 및 Perplexity Distill와 같은 기준 방법들을 능가한다.
- 메모리에서 지식을 제거하면 모델 정확도가 45.1%로 하락하지만, 지식을 다시 도입하면 정확도가 51.8%로 복구되며, 이는 재훈련 없이도 지식 업데이트에 적응 가능한 능력을 입증한다.
- 제안된 방법은 Attention Distill과 유사한 계산 비용(120 GFLOPs)을 가지며, EMDR2 및 Perplexity Distill보다는 훨씬 낮아 높은 효율성을 보인다.
- 다양한 다중모달 지식 소스를 메모리에 통합함으로써 모델은 강력한 일반화 및 강인성을 보이며 성능 향상을 경험한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.