Skip to main content
QUICK REVIEW

[논문 리뷰] Clover: Towards A Unified Video-Language Alignment and Fusion Model

Jingjia Huang, Yinan Li|arXiv (Cornell University)|2022. 07. 16.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

Clover는 비디오, 텍스트, 융합된 다중모달 표현 간의 상관관계를 모델링하는 새로운 삼중모달 정렬(Tri-Modal Alignment, TMA) 목적함수를 통해 교차모달 정렬과 융합을 향상시키는 통합된 비디오-언어 사전학습 모델을 제안한다. 의미적 마스킹과 쌍별 순위 매기기 손실을 통합함으로써 Clover는 효율성을 희생시키지 않은 채 다양한 검색 및 비디오 질의응답(VQA) 작업에서 최신 기준 성능을 달성하며, 전용 작업 모델이나 단순 모델 조합보다 뛰어난 성능을 보인다.

ABSTRACT

Building a universal Video-Language model for solving various video understanding tasks (\emph{e.g.}, text-video retrieval, video question answering) is an open challenge to the machine learning field. Towards this goal, most recent works build the model by stacking uni-modal and cross-modal feature encoders and train it with pair-wise contrastive pre-text tasks. Though offering attractive generality, the resulted models have to compromise between efficiency and performance. They mostly adopt different architectures to deal with different downstream tasks. We find this is because the pair-wise training cannot well \emph{align} and \emph{fuse} features from different modalities. We then introduce extbf{Clover} extemdash a Correlated Video-Language pre-training method extemdash towards a universal Video-Language model for solving multiple video understanding tasks with neither performance nor efficiency compromise. It improves cross-modal feature alignment and fusion via a novel tri-modal alignment pre-training task. Additionally, we propose to enhance the tri-modal alignment via incorporating learning from semantic masked samples and a new pair-wise ranking loss. Clover establishes new state-of-the-arts on multiple downstream tasks, including three retrieval tasks for both zero-shot and fine-tuning settings, and eight video question answering tasks. Codes and pre-trained models will be released at \url{https://github.com/LeeYN-43/Clover}.

연구 동기 및 목표

  • 검색 및 VQA 작업에 대해 별도의 아키텍처를 사용하는 기존 통합 비디오-언어 모델에서의 비효율성과 성능 저하 문제를 해결하기 위해.
  • 새로운 사전학습 목적함수를 통해 단일모달 및 다중모달 인코더의 출력을 명시적으로 상관관계화하여 교차모달 특징 정렬과 융합을 향상시키기 위해.
  • 대규모 검색 작업에서도 높은 효율성을 유지하면서 동시에 하류 비디오 이해 작업에서 강력한 성능을 달성하기 위해.
  • 사전학습 단계에서 의미적 마스킹과 쌍별 순위 매기기 손실을 통해 모델의 일반화 능력과 분류 능력을 향상시키기 위해.

제안 방법

  • 다중모달 표현을 비디오 및 텍스트 단일모달 표현과 정렬하는 Tri-Modal Alignment(TMA)를 도입하여 상호 학습을 강화한다.
  • 핵심 의미적 내용을 유지하면서도 부분적인 입력에 대한 강건성을 향상시키기 위해 의미적 마스킹 전략을 활용하여 마스킹된 샘플을 생성한다.
  • 마스킹된 샘플과 원본 샘플을 구분할 수 있도록 쌍별 순위 매기기 손실을 도입하여 모델의 의미적 차이 감지 능력을 향상시킨다.
  • 기존 사전학습 프레임워크와 호환되며 최소한의 계산 오버헤드를 유발하는 표준 마스킹 언어 모델링(MLM)을 기본 목적함수로 사용한다.
  • TMA를 기존의 대비 및 마스킹 모델링 목적함수와 결합하여 정렬과 융합을 동시에 최적화한다.
  • 비디오 및 텍스트를 위한 별도의 단일모달 인코더와 융합을 위한 공동 다중모달 인코더를 갖춘 공통 인코더 아키텍처를 사용한다.

실험 결과

연구 질문

  • RQ1통합 비디오-언어 모델이 아키텍처적 compromise 없이 검색에서 높은 효율성과 VQA에서 높은 성능을 동시에 달성할 수 있는가?
  • RQ2단일모달 및 다중모달 인코더의 출력을 삼중모달 정렬을 통해 명시적으로 상관관계화하면 교차모달 정렬과 융합이 향상되는가?
  • RQ3의미적 마스킹과 쌍별 순위 매기기 손실이 비디오-텍스트 쌍 간의 미세한 의미적 차이를 포착하는 데 모델의 능력을 향상시킬 수 있는가?
  • RQ4제안된 삼중모달 정렬은 표준 대비 또는 마스킹 언어 모델링 사전학습과 비교해 하류 성능에서 어떤 차이를 보이는가?

주요 결과

  • Clover는 영상-텍스트 검색 벤치마크 3개에서 영상-텍스트 검색 설정(제로샷 및 파인튜닝 모두)에서 새로운 최고 성능을 수립했다.
  • 8개의 비디오 질의응답(VQA) 벤치마크에서 Clover는 전용 작업 모델과 단순 모델 조합(COMB) 모두를 일관되게 능가했다.
  • 삼중모달 정렬을 적용한 모델는 기준 모델 대비 긍정적인 비디오-텍스트 쌍 간 코사인 유사도가 높고, 긍정 및 부정 쌍 간의 간격이 더 크다.
  • 의미적 마스킹과 쌍별 순위 매기기 손실의 통합은 특히 다양한 캡션을 포함한 복잡한 데이터셋인 DiDemo에서 눈에 띄는 성능 향상을 이끌어냈다.
  • 정성적 결과 분석에서 Clover는 더 정확한 기술 및 답변을 생성하는 것으로 나타났으며, 예를 들어 '종이 비행기' 또는 '사자'와 같은 구체적인 표현을 흐린 용어 대신 정확히 식별했다.
  • 제거 실험 결과, TMA만으로도 표준 대비 사전학습보다 성능 향상이 이루어지며, 모든 구성 요소를 포함한 전체 Clover 모델이 가장 우수한 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.