[논문 리뷰] SimVTP: Simple Video Text Pre-training with Masked Autoencoders
SimVTP는 통합된 트랜스포머 인코더를 통해 마스킹된 비디오 튜브와 텍스트 토큰을 동시에 재구성하는 마스킹 자동에코더를 사용하는 단순하면서도 효과적인 비디오-텍스트 사전학습 프레임워크를 제안한다. 이는 매우 높은 마스킹 비율(비디오 90%, 텍스트 75%)과 데이터 효율성을 바탕으로 MSRVTT에서 43.8% R@1을 달성하며, WebVid-2M 데이터의 10%만을 사용함에도 불구하고 최신 기준(SOTA) 성능을 초월한다. 또한 대비 및 매칭 손실을 통해 성능을 더욱 향상시킨다.
This paper presents SimVTP: a Simple Video-Text Pretraining framework via masked autoencoders. We randomly mask out the spatial-temporal tubes of input video and the word tokens of input text and then feed them into a unified autencoder to reconstruct the missing pixels and words. Our SimVTP has several properties: 1) Thanks to the unified autoencoder, SimVTP reconstructs the masked signal of one modality with the help from another modality, which implicitly learns the cross-modal alignment between video tubes and text tokens. 2) SimVTP not only benefits from a high video masking ratio (e.g. 90%) due to the temporal redundancy of video, but also needs a high text masking ratio (e.g. 75%), which is much higher than BERT (e.g. 15%), to achieve optimal performance. This is because the aid of video modality makes text reconstruction less challenging, which thus needs a higher mask ratio to make the pretext harder for useful feature learning. 3) Equipping SimVTP with video-text contrastive learning (VTC) and video-text matching (VTM), which are two commonly used cross-modal training strategies, could further improve the transferable performance significantly. 4) SimVTP is dataefficent, e.g., pre-training only on 10% data of WebVid-2M, SimVTP achieves surprisingly good results (43.8 R@1) on MSRVTT, which is far above recent state-of-the-art methods pre-trained on both CC3M and WebVid-2M. We transfer our pre-trained model to various downstream tasks and achieve superior performance. The codes and models will be released at https://github.com/mayuelala/SimVTP.
연구 동기 및 목표
- 객체 검출기나 영역 학습기와 같은 복잡한 구성 요소 없이도 단순하고 통합된 비디오-텍스트 사전학습 프레임워크를 개발하는 것.
- 마스킹 자동에코딩을 통한 비디오-텍스트 학습에서 매우 높은 마스킹 비율(비디오 최대 90%, 텍스트 최대 75%)의 효과성을 조사하는 것.
- 마스킹된 비디오-텍스트 쌍이 대비 및 매칭 사전학습을 위한 효과적인 데이터 증강 기법이 될 수 있는지 평가하는 것.
- WebVid-2M의 10% 데이터만을 사용하여도 SOTA 성능을 달성함으로써 데이터 효율성을 입증하는 것.
- 마스킹 자동에코딩 환경에서 인코더 초기화 방식이 다중모달 사전학습 성능에 미치는 영향을 탐색하는 것.
제안 방법
- 통합된 트랜스포머 인코더가 비디오 튜브와 텍스트 토큰을 모두 처리하여, 마스킹된 입력의 다중모달 재구성 기능을 제공한다.
- 비디오 튜브는 MAE 유사 전략, 텍스트 토큰은 BERT 유사 전략을 사용해 무작위 마스킹하며, 최적의 성능을 위해 각각 90%와 75%의 마스킹 비율을 적용한다.
- 모델은 다중모달 간의 교차 attention을 통해 누락된 비디오 픽셀과 단어 토큰을 재구성함으로써, 암묵적으로 튜브-단어 정렬을 학습한다.
- 프레임워크는 마스킹된 입력에 대해 비디오-텍스트 대비 학습(VTC)과 비디오-텍스트 매칭(VTM)을 통합하여 전이 성능을 더욱 향상시킨다.
- 사전학습에 비디오MAE의 ImageNet-1K 또는 Kinetics-400 가중치를 초기화로 사용하며, BERT나 감독 학습 기반 ImageNet-21K 가중치보다 성능이 뛰어나다.
- 학습은 마스킹된 비디오-텍스트 쌍을 대상으로 하며, VTC는 총 데이터의 10%에 해당하는 가시 토큰에만 적용되어 GPU 메모리와 계산 자원을 절감한다.
실험 결과
연구 질문
- RQ1통합된 마스킹 자동에코더 프레임워크가 마스킹된 비디오 튜브와 텍스트 토큰을 동시에 재구성하여 효과적인 다중모달 표현을 학습할 수 있는가?
- RQ2매우 높은 마스킹 비율(비디오 90%, 텍스트 75%)을 사용함에도 불구하고, 높은 난이도에도 불구하고 특징 학습이 향상되는가?
- RQ3마스킹된 비디오-텍스트 쌍이 대비 학습(VTC)과 매칭 학습(VTM)을 위한 효과적인 데이터 증강 기법이 될 수 있는가?
- RQ4기존에 더 큰 데이터셋으로 사전학습된 방법들과 비교해 SimVTP는 어느 정도의 데이터 효율성을 달성하는가?
- RQ5마스킹 자동에코딩 환경에서 인코더 초기화 방식이 비디오-텍스트 사전학습 성능에 어떤 영향을 미치는가?
주요 결과
- SimVTP는 WebVid-2M의 10%에 해당하는 240K개의 데이터만을 사용하여 MSRVTT에서 43.8% R@1 성능을 달성하며, CC3M 및 WebVid-2M와 같은 더 큰 데이터셋으로 사전학습된 최근 SOTA 방법들을 능가한다.
- 비디오 90%, 텍스트 75%의 마스킹 비율을 적용함으로써 SimVTP는 최적의 성능을 달성하였으며, 이는 다중모달 신호의 보조 덕분에 고마스킹이 유익함을 입증한다.
- 마스킹된 비디오-텍스트 쌍에 VTC와 VTM를 적용하면 성능 향상이著명하며, 마스킹된 입력에 대해 VTC를 적용한 결과 36.8% R@1을 기록하여 전체 데이터로 학습된 방법들을 능가한다.
- VideoMAE 사전학습 가중치(Kinetics-400 또는 ImageNet-1K)를 인코더 초기화로 사용할 경우, BERT나 감독 학습 기반 ImageNet-21K 가중치보다 더 좋은 성능을 낸다.
- 교차 어텐션 시각화 결과, 명사 및 동사 토큰이 관련된 시각적 영역에 주로 집중함을 확인하여 효과적인 다중모달 정렬이 이루어짐을 확인할 수 있다.
- 모델는 원본 텍스트보다 더 자연스럽고 종종 더 정확한 텍스트 설명을 재구성함으로써, 강력하고 의미 있는 표현 학습이 이루어졌음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.