Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Contrastive Pre-Training for Efficient Video-Text Retrieval

Fangxun Shu, Biaolong Chen|arXiv (Cornell University)|2022. 12. 02.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 비디오와 텍스트에서 높은 비율의 공간 영역을 마스킹하고, 대비 학습을 통해 다중모달 표현을 정렬함으로써 계산 비용을 줄이는 효율적인 엔드 투 엔드 비디오-언어 사전학습 프레임워크인 마스킹된 대비 사전학습(MAC)을 제안한다. MAC는 FLOPs를 60% 감소시키고 사전학습 속도를 3배 빠르게 하면서도 비디오-텍스트 검색 벤치마크에서 최신 기술 성능(SOTA)을 달성한다.

ABSTRACT

We present a simple yet effective end-to-end Video-language Pre-training (VidLP) framework, Masked Contrastive Video-language Pretraining (MAC), for video-text retrieval tasks. Our MAC aims to reduce video representation's spatial and temporal redundancy in the VidLP model by a mask sampling mechanism to improve pre-training efficiency. Comparing conventional temporal sparse sampling, we propose to randomly mask a high ratio of spatial regions and only feed visible regions into the encoder as sparse spatial sampling. Similarly, we adopt the mask sampling technique for text inputs for consistency. Instead of blindly applying the mask-then-prediction paradigm from MAE, we propose a masked-then-alignment paradigm for efficient video-text alignment. The motivation is that video-text retrieval tasks rely on high-level alignment rather than low-level reconstruction, and multimodal alignment with masked modeling encourages the model to learn a robust and general multimodal representation from incomplete and unstable inputs. Coupling these designs enables efficient end-to-end pre-training: reduce FLOPs (60% off), accelerate pre-training (by 3x), and improve performance. Our MAC achieves state-of-the-art results on various video-text retrieval datasets, including MSR-VTT, DiDeMo, and ActivityNet. Our approach is omnivorous to input modalities. With minimal modifications, we achieve competitive results on image-text retrieval tasks.

연구 동기 및 목표

  • 전체 해상도의 비디오 프레임과 텍스트를 처리함으로써 발생하는 엔드 투 엔드 비디오-언어 사전학습의 높은 계산 비용을 해결하기 위해.
  • 다중모달 정렬 성능을 훼손하지 않으면서도 비디오 표현 내의 공간적 및 시간적 부재를 줄이기 위해.
  • 기존의 마스크-예측 방식을 대체하여 검색에 적합한 마스크-정렬 파라다임을 도입함으로써 사전학습 효율성을 향상시키기 위해.
  • 대비 학습을 통해 불완전하고 마스킹된 입력으로부터 강력하고 일반화 가능한 다중모달 표현을 얻기 위해.
  • 최소한의 아키텍처 수정과 감소된 데이터 요구 사항으로도 강력한 비디오-텍스트 검색 성능를 달성하기 위해.

제안 방법

  • MAE와 BERT에서 사용되는 표준 마스크-예측 방식을 대체하는 마스크-정렬 파라다임을 도입한다.
  • 비디오 프레임에 60% 비율로 무작위 공간 마스킹을 적용하고, 텍스트에는 15% 비율로 마스킹을 적용하여, 오직 가시 영역만 인코더에 입력한다.
  • 마스킹 조건 하에서 효율적인 어텐션 계산과 개선된 시공간 모델링을 가능하게 하는 분할된 시공간 자기어텐션을 사용한다.
  • 마스킹된 비디오와 텍스트 뷰 간의 대비 학습을 통해 공통 임베딩 공간에서 정렬함으로써 고수준의 의미 정렬을 촉진한다.
  • 비디오와 텍스트 모odal을 동시에 이중 마스킹하여 정렬의 난이도를 높이고 표현의 강건성을 향상시킨다.
  • 간단하고 즉시 사용 가능한 설계를 활용하여, 추가적인 데이터 증강 또는 다중 해상도 융합 없이도 이미지-텍스트 검색에 일반화 가능하다.

실험 결과

연구 질문

  • RQ1비디오와 텍스트에서 공간적 및 시간적 영역의 높은 비율을 마스킹함으로써 검색 성능에 손상이 가지 않고 사전학습 효율성을 향상시킬 수 있는가?
  • RQ2마스크-정렬 대비 학습 접근 방식이 비디오-텍스트 검색 작업에서 마스크-예측 방식보다 우월한가?
  • RQ3비디오와 텍스트 모달을 동시에 이중 마스킹하면 교차 모달 정렬과 표현 품질에 어떤 영향을 미치는가?
  • RQ4다중모달 검색 설정에서 비디오와 텍스트의 최적 마스킹 비율은 무엇이며, 성능 및 계산에 어떤 영향을 미치는가?
  • RQ5마스크된 대비 사전학습 프레임워크는 FLOPs를 줄이고 학습 속도를 높이면서도 다른 다중모달 작업에 효과적으로 적용될 수 있는가?

주요 결과

  • MAC는 표준 엔드 투 엔드 방법 대비 FLOPs를 60% 감소시키고 사전학습 속도를 3배 빠르게 한다.
  • MAC는 더 적은 데이터와 경량 아키텍처로 MSR-VTT에서 R@1 38.9%를 기록하여 새로운 최신 기술 성능(SOTA)을 수립한다.
  • 비디오와 텍스트를 모두 이중 마스킹하면 단일 마스킹보다 성능이 향상되며, MSR-VTT에서 R@1이 35.8%에서 36.4%로 상승한다.
  • 분할된 시공간 자기어텐션과 함께 무작위 마스킹을 적용한 방법은 튜브 마스킹 및 마스킹 없음보다 우수하여 MSR-VTT에서 R@1 36.4%, R@5 63.8%, R@10 73.0%를 달성한다.
  • 이 방법은 이미지-텍스트 검색으로도 잘 일반화되며, 강력한 데이터 증강이나 다중 해상도 융합 없이도 경쟁 가능한 성능을 기록한다.
  • 더 높은 비디오 마스킹 비율(60%)과 낮은 텍스트 마스킹 비율(15%)이 최적임을 확인하였으며, 이는 MAE와 BERT의 정보 밀도 원칙과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.