Skip to main content
QUICK REVIEW

[논문 리뷰] FILIP: Fine-grained Interactive Language-Image Pre-Training

Lewei Yao, Runhui Huang|arXiv (Cornell University)|2021. 11. 09.
Multimodal Machine Learning Applications참고 문헌 29인용 수 205
한 줄 요약

FILIP은 토큰별 최대 유사도를 통해 이미지-텍스트 정렬을 위한 미세한 교차 모달 지연 상호작용을 도입하고, 오프라인 전처리 및 새로운 300M 이미지-텍스트 데이터셋(FILIP300M)으로 강력한 제로샷 및 검색 성능을 달성합니다.

ABSTRACT

Unsupervised large-scale vision-language pre-training has shown promising advances on various downstream tasks. Existing methods often model the cross-modal interaction either via the similarity of the global feature of each modality which misses sufficient information, or finer-grained interactions using cross/self-attention upon visual and textual tokens. However, cross/self-attention suffers from inferior efficiency in both training and inference. In this paper, we introduce a large-scale Fine-grained Interactive Language-Image Pre-training (FILIP) to achieve finer-level alignment through a cross-modal late interaction mechanism, which uses a token-wise maximum similarity between visual and textual tokens to guide the contrastive objective. FILIP successfully leverages the finer-grained expressiveness between image patches and textual words by modifying only contrastive loss, while simultaneously gaining the ability to pre-compute image and text representations offline at inference, keeping both large-scale training and inference efficient. Furthermore, we construct a new large-scale image-text pair dataset called FILIP300M for pre-training. Experiments show that FILIP achieves state-of-the-art performance on multiple downstream vision-language tasks including zero-shot image classification and image-text retrieval. The visualization on word-patch alignment further shows that FILIP can learn meaningful fine-grained features with promising localization ability.

연구 동기 및 목표

  • 세밀한 비전-언어 정렬을 글로벌 특징 유사도 이상으로 발전시키려는 동기 부여.
  • 교차 모달 지연 상호작용이 있는 효율적인 듀얼-스트림 VLP 프레임워크 제공.
  • 토큰-별 최대 유사도는 미세한 정렬을 개선하면서 오프라인 전처리를 가능하게 함을 보여줌.
  • 대규모 데이터셋 FILIP300M(3억 개 이미지-텍스트 쌍)으로 효과 입증.
  • 제로샷 및 검색 성능 향상을 위한 데이터 증강 및 프롬프트 템플릿 전략 탐색.

제안 방법

  • 이미지와 텍스트 각각에 대한 듀얼-스트림 비전 트랜스포머 인코더.
  • 이미지 패치와 텍스트 토큰 간의 토큰-별 최대 유사도를 계산하고, 패딩되지 않은 토큰에 대해 평균을 내어 이미지-텍스트 유사도를 형성합니다(식 3–5).
  • 이미지-대-텍스트 및 텍스트-대-이미지 쌍에 대한 대조 손실을 적용하고, 두 방향 손실의 1/2 합으로 최종 손실을 구성합니다(식 1).
  • 제로샷 분류를 개선하기 위한 프롬프트 템플릿과 프롬프트 앙상블의 사용, 앙상블을 위한 평균 토큰-별 유사도(섹션 3.1.2).
  • 자연어 데이터 및 이미지에 대한 증강(자동증강 및 텍스트 역번역 포함)으로 추가 쌍 생성(섹션 3.2).
  • 필립300M(~340M 정제된 쌍)으로의 사전학습, 데이터셋 필터링 및 추가 공개 데이터셋(CC3M, CC12M, YFCC100M) 통합(섹션 3.3).

실험 결과

연구 질문

  • RQ1더 작은 것은 아니고 듀얼-스트림 모델의 효율성을 해치지 않으면서 토큰-별 교차 모달 인터랙션이 비전-언어 정렬을 개선할 수 있는가?
  • RQ2전역 특징 유사도를 토큰 수준의 최대 유사도로 대체하면 표준 데이터셋에서 제로샷 및 검색 성능이 향상되는가?
  • RQ3데이터 증강 및 프롬프트 템플릿이 대규모 VLP에서 제로샷 분류 및 검색에 어떤 영향을 미치는가?
  • RQ4대규모이면서도 효율적으로 활용 가능한 데이터셋(FILIP300M)의 활용이 다운스트림 비전-언어 작업에 미치는 영향은?
  • RQ5이미지/텍스트 표현의 오프라인 전처리가 미세한 상호작용과 어떻게 결합되어 확장 가능한 추론을 가능하게 하는가?

주요 결과

  • FILIP은 제로샷 이미지 분류 및 이미지-텍스트 검색을 포함한 여러 다운스트림 작업에서 최첨단 결과를 달성합니다.
  • 제로샷 12-데이터셋 ImageNet 분류에서 FILIP base는 CLIP 대비 평균 Top-1 점수를 5.6포인트, FILIP large는 3.0포인트 상승시키며 더 적은 학습 데이터(340M 대 400M)를 사용합니다.
  • 제로샷 이미지-텍스트 검색에서 MSCOCO에서 CLIP보다 우수한 성능을 보이며(예: image-to-text R@1: 60.1 vs CLIP 베이스라인의 59.xx 등 표의 정확한 수치 유지) 뚜렷한 이득을 제공합니다.
  • Flickr30K 및 MSCOCO에서 제로샷 및 파인튜닝된 이미지-텍스트 검색 설정 모두에서 경쟁력 있거나 우수한 결과를 달성하며, 여러 지표에서 최첨단 성능을 달성합니다(표 2–3).
  • 단어-패치 정합 시각화가 예를 들어 ‘electric’과 같은 구성요소를 물체에서 정확하게 로컬라이즈하는 의미 있는 미세 정합을 보여줍니다.
  • 어블레이션 연구에서 이미지/텍스트 증강과 교차 모달 지연 상호작용이 각각 성능 향상에 기여함을 확인합니다(표 4).
  • 최적화(임베딩 크기 축소, fp16 정밀도, 토큰 선택)를 통한 효율성 분석에서 지연 상호작용은 메모리/시간 비용이 modest하게 유지되며 실용적임을 보여줍니다(표 5).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.