Skip to main content
QUICK REVIEW

[논문 리뷰] VLM: Task-agnostic Video-Language Model Pre-training for Video Understanding

Hu Xu, Gargi Ghosh|arXiv (Cornell University)|2021. 05. 20.
Multimodal Machine Learning Applications참고 문헌 34인용 수 6
한 줄 요약

이 논문은 단일 BERT 스타일 인코더를 사용해 영상과 텍스트 입력을 공동으로 처리하는 작업에 종속되지 않는 비디오-언어 미리 훈련 프레임워크인 VLM을 제안한다. 마스킹된 모odal 모델링(MMM)과 통합된 마스킹 토큰 손실을 도입함으로써 VLM은 효과적인 다중모态 융합을 가능하게 하면서도 단모달 능력을 유지하며, 이전 방법보다 훨씬 적은 파라미터로 검색 및 캡셔닝 작업에서 최고 성능을 달성한다.

ABSTRACT

We present a simplified, task-agnostic multi-modal pre-training approach that can accept either video or text input, or both for a variety of end tasks. Existing pre-training are task-specific by adopting either a single cross-modal encoder that requires both modalities, limiting their use for retrieval-style end tasks or more complex multitask learning with two unimodal encoders, limiting early cross-modal fusion. We instead introduce new pretraining masking schemes that better mix across modalities (e.g. by forcing masks for text to predict the closest video embeddings) while also maintaining separability (e.g. unimodal predictions are sometimes required, without using all the input). Experimental results show strong performance across a wider range of tasks than any previous methods, often outperforming task-specific pre-training. Code is made available at https://github.com/pytorch/fairseq/tree/main/examples/MMPT.

연구 동기 및 목표

  • 다양한 최종 작업을 위해 태스크에 종속되지 않는 통합된 미리 훈련 프레임워크를 개발하여, 태스크별 아키텍처 없이도 다양한 최종 작업을 지원한다.
  • 기존 방법의 한계를 극복하기 위해 단일 다중모달 인코더에 의존하는 방법(단모달 사용 제한) 또는 복수의 단모달 인코더를 사용하는 방법(복잡한 다중태스크 훈련 필요)을 피한다.
  • 미리 훈련 중에 새로운 마스킹 전략을 도입함으로써 상호모달 의존성을 유도하면서도 단모달 입력에 대해 분리 가능성은 유지함으로써 다중모달 융합을 효과적으로 학습한다.
  • 단일 경량 인코더가 검색 및 캡셔닝 벤치마크에서 더 큰 태스크별 특화 모델을 능가할 수 있음을 입증한다.

제안 방법

  • 학습 예제의 일부에서 전체 모달리티(텍스트 또는 영상)를 무작위로 마스킹하는 마스킹된 모달 모델(MMM)을 도입하여, 마스킹된 모달리티를 다른 모달리티를 사용해 재구성하도록 모델을 강제한다.
  • 영상과 텍스트의 공동 임베딩을 사용해 마스킹된 토큰을 예측하는 통합된 마스킹 토큰 손실을 사용하며, 영상 및 텍스트에 대해 별도의 손실을 사용하는 것과 대체한다.
  • 영상과 텍스트 토큰을 연결하여 공유된 잠재 공간에서 처리하기 위해 단일 BERT 기반 트랜스포머 인코더를 사용함으로써 종단 간 공동 표현 학습을 가능하게 한다.
  • 微조정 중에 태스크별 주의 마스크를 적용하여 동일한 미리 훈련된 인코더를 검색, 캡셔닝 및 기타 작업에 적응시킨다.
  • MFM-MLM 및 MMM 방식을 번갈아가며 적용하는 공동 마스킹 전략을 사용해 대규모 영상-텍스트 쌍으로 미리 훈련한다.
  • 양방향 입력이 존재할 때도 단모달 예측이 가능하게 하여 모델의 분리 가능성을 유지함으로써 검색 및 생성 작업과의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1다양한 최종 작업(예: 검색 및 캡셔닝)을 지원하기 위해 태스크에 종속되지 않는 방식으로 단일 통합 영상-언어 모델을 미리 훈련시킬 수 있는가?
  • RQ2복잡한 다중태스크 목표가 필요 없이도 단모달 능력을 손상시키지 않고 미리 훈련 중에 다중모달 융합을 효과적으로 학습할 수 있는가?
  • RQ3표준 프레임 마스킹 및 언어 마스킹 모델링과 비교해 전체 모달리티를 마스킹하는(MMM) 것이 공동 표현 학습에 더 나은 성능을 내는가?
  • RQ4영상 및 텍스트에 대해 별도의 손실을 사용하는 것보다 통합된 마스킹 토큰 손실이 공동 표현 학습에서 더 나은 성능을 내는가?
  • RQ5더 큰 태스크별 특화 모델에 비해 더 작고 통합된 인코더가 영상 이해 벤치마크에서 더 나은 성능을 내는가?

주요 결과

  • VLM은 더 작은 모델을 사용하고도 텍스트 기반 영상 검색(R@1: YouCook2에서 27.05)에서 태스크별 미리 훈련 기반 모델보다 2% 이상 높은 성능을 기록했으며, 영상 캡셔닝(CIDEr: 1.3869)에서도 1% 높은 성능을 기록했다.
  • 제거 실험 결과, MMM를 제거한 경우(R@1: 15.12) MFM-MLM만 사용하는 것보다 성능이 떨어지며, 이는 MMM가 효과적인 다중모달 학습을 위해 필수적임을 시사한다.
  • 통합된 마스킹 토큰 손실을 사용할 경우, 별도의 MFM-MLM 손실을 사용할 때보다 성능이 향상되어 R@1이 26.93에서 27.05로 상승했다.
  • 긴 클립(최소 16개의 텍스트 토큰)에 대해 미세조정을 수행할 경우에도 강력한 성능을 유지하지만, 약간의 성능 저하가 발생함을 확인하여, 짧은 클립으로 미리 훈련하는 것이 더 효과적일 수 있음을 시사한다.
  • 시각화 결과, 주의 헤드가 의미 있는 다중모달 정렬을 학습하고 있음을 확인할 수 있었으며, 예를 들어 '소유소이'라는 단어가 소유소이를 부어내리는 영상 프레임과 연결되는 등 단어 수준의 공참조를 인식하고 있음을 보여, 효과적인 다중모달 추론이 이루어지고 있음을 확인했다.
  • 기존 방법보다 훨씬 적은 파라미터로 경쟁 가능한 성능을 달성하여, 파라미터 효율성 향상과 다중모달 간의 특징 공유가 향상되었음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.