Skip to main content
QUICK REVIEW

[논문 리뷰] HiVLP: Hierarchical Vision-Language Pre-Training for Fast Image-Text Retrieval

Feilong Chen, Xiuyi Chen|arXiv (Cornell University)|2022. 05. 24.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

HiVLP는 저차원 특징을 이용한 군집 검색과 고차원 특징을 이용한 정밀 검색을 결합함으로써 빠른 이미지-텍스트 검색을 위한 계층적 시각-언어 사전학습 프레임워크를 제안한다. 이는 UNITER와 같은 융합 기반 모델 대비 최대 120,649배 빠른 추론 속도를 달성하면서도 경쟁력 있는 정확도를 유지하며, 검색 성능에서도 최신 기술을 초월한다.

ABSTRACT

In the past few years, the emergence of vision-language pre-training (VLP) has brought cross-modal retrieval to a new era. However, due to the latency and computation demand, it is commonly challenging to apply VLP in a real-time online retrieval system. To alleviate the defect, this paper proposes a extbf{Hi}erarchical extbf{V}ision- extbf{}Language extbf{P}re-Training ( extbf{HiVLP}) for fast Image-Text Retrieval (ITR). Specifically, we design a novel hierarchical retrieval objective, which uses the representation of different dimensions for coarse-to-fine ITR, i.e., using low-dimensional representation for large-scale coarse retrieval and high-dimensional representation for small-scale fine retrieval. We evaluate our proposed HiVLP on two popular image-text retrieval benchmarks, i.e., Flickr30k and COCO. Extensive experiments demonstrate that our HiVLP not only has fast inference speed but also can be easily scaled to large-scale ITR scenarios. The detailed results show that HiVLP is $1,427$$\sim$$120,649 imes$ faster than the fusion-based model UNITER and 2$\sim$5 faster than the fastest embedding-based model LightingDot in different candidate scenarios. It also achieves about +4.9 AR on COCO and +3.8 AR on Flickr30K than LightingDot and achieves comparable performance with the state-of-the-art (SOTA) fusion-based model METER.

연구 동기 및 목표

  • 실시간 이미지-텍스트 검색 시스템에서 융합 기반 시각-언어 모델의 높은 지연 시간 문제를 해결한다.
  • 임베딩 기반 모델에서 거대한 후보 풀에 대한 내적곱 매칭의 계산 병목 현상을 해결한다.
  • 계층적 특징 표현을 활용한 군집-정밀 검색 파이프라인을 도입함으로써 효율적이고 확장 가능한 검색을 가능하게 한다.
  • 다중 해상도 특징 추출을 통해 추론 시간을 극적으로 줄이면서도 높은 검색 정확도를 유지한다.
  • 언어 표현, 시각-언어 매칭, 계층적 검색 정렬을 동시에 최적화하는 훈련 프레임워크를 설계한다.

제안 방법

  • 동일한 시각 및 텍스트 인코더에서 증가하는 차원의 계층적 특징을 추출하기 위해 중간 트랜스포머 레이어에 초기 출력 레이어(EOL)를 도입한다.
  • 저차원 EOL 출력을 사용해 대규모 후보 집합에서 신속한 군집 검색을 수행하고, 이후 고차원 출력을 활용해 축소된 집합에서 정밀한 검색을 수행한다.
  • 특징의 다중 해상도 간 정렬을 위해 언어 표현 모델링(LRM), 시각-언어 매칭(VLM), 계층적 검색 학습(HRL)의 세 가지 목적함수를 함께 훈련한다.
  • 후보 사전 인코딩과 온라인 쿼리 처리를 분리함으로써 병렬 처리를 가능하게 하고 종단 간 지연 시간을 감소시킨다.
  • 공유된 아키텍처를 가진 사전 훈련된 시각 및 언어 트랜스포머를 활용해 모든 수준에서 표현 품질을 유지한다.
  • Grad-CAM 시각화를 적용하여 텍스트 토큰과 관련된 시각적 영역 간의 주의 분포 일치를 검증함으로써 다중 모odal 주의 학습의 효과성을 확인한다.

실험 결과

연구 질문

  • RQ1계층적 표현 전략이 정확도를 희생시키지 않고 이미지-텍스트 검색을 크게 가속화할 수 있는가?
  • RQ2단일 수준 임베딩 대비 다중 해상도 특징 추출이 속도 및 검색 성능 측면에서 어떻게 비교되는가?
  • RQ3100K+ 이미지와 같은 대규모 후보 풀에 대해 제안된 HiVLP 프레임워크가 낮은 지연 시간을 유지하면서 얼마나 잘 확장될 수 있는가?
  • RQ4트랜스포머 인코더에 초기 출력 레이어를 통합함으로써 성능 저하를 최소화하면서 효과적인 군집-정밀 검색을 달성할 수 있는가?
  • RQ5표준 벤치마크에서 HiVLP는 최신 융합 기반 및 임베딩 기반 모델 대비 속도와 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • COCO-full 벤치마크(123,287장의 이미지)에서 HiVLP는 융합 기반 모델인 UNITER 대비 최대 120,649배 빠른 추론 속도를 달성한다.
  • Flickr30k-full 벤치마크에서 HiVLP는 UNITER 대비 36,051배 빠르며, 대규모 검색 시나리오에 대한 확장성을 입증한다.
  • Flickr30k에서 HiVLP는 가장 빠른 임베딩 기반 모델인 LightingDot 대비 2.23배 빠르며, COCO에서는 후보 수가 5배 많음에도 불구하고 3.33배 더 빠르다.
  • COCO에서 HiVLP는 LightingDot 대비 평균 소환률(AR) +4.9% 향상되었고, Flickr30k에선 +3.8% 향상되어 더 높은 속도에도 불구하고 뛰어난 정확도를 확보했다.
  • 제거 실험을 통해 다중 수준의 EOL 출력을 활용한 계층적 검색 전략이 이미지-텍스트 및 텍스트-이미지 작업 전반에서 검색 성능을 크게 향상시킨다는 것이 확인되었다.
  • 정성적 결과에서는 Grad-CAM 주의 맵이 관련된 시각적 영역과 잘 일치함을 확인하여, 계층적 프레임워크에서 효과적인 다중 모달 주의 학습이 이루어졌음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.