[논문 리뷰] LightningDOT: Pre-training Visual-Semantic Embeddings for Real-Time Image-Text Retrieval
LightningDOT는 세 가지 새로운 목적함수인 VMLM, SMRM 및 CMR를 사용해 사전 훈련된 시각 및 텍스트 인코더를 사전 훈련함으로써 계산 비용이 높은 교차 어텐션을 효율적인 도트 곱 매칭으로 대체하는 빠르고 정확한 이미지-텍스트 검색 방법을 제안한다. 이는 기존 사전 훈련된 모델 대비 추론 속도를 최대 23,000배 빠르게 하면서도 Flickr30k, COCO 및 Multi30K 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.
Multimodal pre-training has propelled great advancement in vision-and-language research. These large-scale pre-trained models, although successful, fatefully suffer from slow inference speed due to enormous computation cost mainly from cross-modal attention in Transformer architecture. When applied to real-life applications, such latency and computation demand severely deter the practical use of pre-trained models. In this paper, we study Image-text retrieval (ITR), the most mature scenario of V+L application, which has been widely studied even prior to the emergence of recent pre-trained models. We propose a simple yet highly effective approach, LightningDOT that accelerates the inference time of ITR by thousands of times, without sacrificing accuracy. LightningDOT removes the time-consuming cross-modal attention by pre-training on three novel learning objectives, extracting feature indexes offline, and employing instant dot-product matching with further re-ranking, which significantly speeds up retrieval process. In fact, LightningDOT achieves new state of the art across multiple ITR benchmarks such as Flickr30k, COCO and Multi30K, outperforming existing pre-trained models that consume 1000x magnitude of computational hours. Code and pre-training checkpoints are available at https://github.com/intersun/LightningDOT.
연구 동기 및 목표
- 대규모 시각-언어 사전 훈련 모델의 높은 추론 지연 문제를 해결하여 실시간 배포를 가능하게 하기 위해.
- 간단한 도트 곱 매칭이 교차 어텐션 기반 메커니즘 없이도 경쟁 가능한 성능을 달성할 수 있는지 탐색하기 위해.
- 오프라인으로 학습된 시각-의미적 임베딩을 사용해 빠르고 캐시된 검색을 가능하게 하는 사전 훈련 프레임워크를 개발하기 위해.
- 교차 모odal 어텐션을 제거함에도 불구하고 새로운 사전 훈련 목적함수를 통해 정확도를 유지하거나 향상시키기 위해.
- 추론 시 최소한의 계산 비용으로도 새로운 최신 기술 수준(SOTA)을 확립하기 위해.
제안 방법
- 추론 시 교차 어텐션을 피하기 위해 후기 융합 기반의 별도의 시각 및 텍스트 인코더를 사전 훈련한다.
- 시각적 특징을 텍스트 표현 학습에 통합하기 위해 시각 임베딩 융합 마스크 언어 모델링(VMLM)을 도입한다.
- 텍스트 의미를 시각적 표현 학습에 통합하기 위해 의미 임베딩 융합 마스크 영역 모델링(SMRM)을 도입한다.
- 이미지와 텍스트 임베딩을 정렬하기 위해 교차 모달 검색(CMR)을 공동 사전 훈련 목적함수로 활용한다.
- 모든 이미지 및 텍스트 임베딩을 오프라인으로 캐시하고 실시간 검색을 위해 즉각적인 도트 곱 매칭을 사용한다.
- 어느 정도 어텐션 제거로 인한 성능 손실을 복구하기 위해 도트 곱 이후 경량 재순서 정렬 모듈을 적용한다.
실험 결과
연구 질문
- RQ1추론 시 교차 어텐션을 사용하지 않더라도 시각-언어 모델이 최신 기술 수준(SOTA)의 이미지-텍스트 검색 성능을 달성할 수 있는가?
- RQ2어느 정도 어텐션 없이도 교차 모달 정보를 융합하는 사전 훈련 목적함수는 여전히 강력한 시각-의미적 정렬을 이끌 수 있는가?
- RQ3VMLM, SMRM 및 CMR 사전 훈련 작업의 조합이 검색 정확도와 효율성에 어떤 영향을 미치는가?
- RQ4오프라인 임베딩 인덱싱과 도트 곱 매칭이 실시간 시스템에서 어텐션 기반 검색을 얼마나 잘 대체할 수 있는가?
- RQ5영어 캡션으로만 훈련된 모델이 번역-테스트를 통해 다국어 검색에 효과적으로 일반화될 수 있는가?
주요 결과
- LightningDOT는 Flickr30k, COCO 및 Multi30K 벤치마크에서 새로운 최신 기술 수준(SOTA) 성능을 달성하였으며, 1000배 이상 더 많은 계산 시간이 필요한 모델들을 능가한다.
- COCO에서 LightningDOT는 평균 재확인률(AR) 83.7%를 달성하였고, 재순서 정렬을 적용한 경우 UNITER(86.6%)를 초월한다.
- Flickr30k 및 COCO에서 추론 속도가 600~1900배 빨라졌으며, 더 큰 후보 풀(120,000개 이상 이미지)에서는 최대 23,000배 빨라졌다.
- 재순서 정렬 메커니즘이 어 attention 제거로 인한 성능 손실을 대부분 복구하였으며, COCO에서 AR 86.8%를 달성하여 전체 UNITER 성능에 가까운 성능을 확보하였다.
- 번역-테스트 조건에서 LightningDOT는 영어 외에 독일어, 프랑스어, 체코어, 일본어 및 중국어를 포함한 다국어 벤치마크에서 새로운 최신 기술 수준(SOTA)을 수립하였으며, 이는 영어 캡션으로만 훈련된 모델임에도 불구하고 효과적인 일반화를 보였다.
- 제거 실험 결과 VMLM와 SMRM가 함께 성능 향상을 이끌었으며, CMR만으로도 AR가 +1.4 향상되었고, 세 가지 작업을 모두 적용한 경우 최고의 성능을 기록하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.