Skip to main content
QUICK REVIEW

[논문 리뷰] MDMMT-2: Multidomain Multimodal Transformer for Video Retrieval, One More Step Towards Generalization

Alexander Kunitsyn, Maksim Kalashnikov|arXiv (Cornell University)|2022. 03. 14.
Advanced Image and Video Retrieval Techniques인용 수 7
한 줄 요약

이 논문은 단일 통합 다중모달 트랜스포머 모델인 MDMMT-2를 제안하며, 약한 감독, 텍스트-이미지, 텍스트-비디오 데이터셋을 결합하고 삼단계 훈련 절차, 이중 위치 인코딩, 사전 훈련된 CLIP 및 비디오 백본 모델을 활용한 효율적 전이 학습을 통해 다섯 가지 다양한 텍스트-비디오 검색 벤치마크—MSR-VTT, LSMDC, MSVD, YouCook2, TGIF—에서 최신 기술 수준 성능을 달성한다.

ABSTRACT

In this work we present a new State-of-The-Art on the text-to-video retrieval task on MSR-VTT, LSMDC, MSVD, YouCook2 and TGIF obtained by a single model. Three different data sources are combined: weakly-supervised videos, crowd-labeled text-image pairs and text-video pairs. A careful analysis of available pre-trained networks helps to choose the best prior-knowledge ones. We introduce three-stage training procedure that provides high transfer knowledge efficiency and allows to use noisy datasets during training without prior knowledge degradation. Additionally, double positional encoding is used for better fusion of different modalities and a simple method for non-square inputs processing is suggested.

연구 동기 및 목표

  • 도메인 특화 미세조정 없이 다양한 도메인에서 우수한 성능을 내는 일반 목적의 텍스트-비디오 검색 모델을 개발하는 것.
  • 훈련 중에 약한 감독, 텍스트-이미지, 텍스트-비디오 데이터셋을 결합하여 모델 일반화 능력을 향상시키는 것.
  • 노이즈가 많고 다양한 데이터 소스에서 훈련할 때 과적합과 지식 손실을 방지하는 것.
  • 이중 위치 인코딩과 비정방형 비디오 입력에 대한 강력한 처리를 통해 다중모달 융합을 향상시키는 것.
  • 단일 통합 모델 아키텍처를 사용하여 여러 벤치마크에서 최신 기술 수준 성능을 달성하는 것.

제안 방법

  • 약한 감독 비디오(HT100M), 커뮤니티 레이블링 텍스트-이미지 쌍, 텍스트-비디오 쌍의 세 가지 데이터 소스를 결합하여 훈련 데이터의 다양성과 규모를 증가시킨다.
  • 사전 훈련된 백본의 미세조정을 방지하는 삼단계 훈련 절차를 적용하여 일반화 능력을 유지하고 도메인 특화 과적합을 방지한다.
  • 트랜스포머 인코더에서 시각, 운동, 청각, 텍스트 모odal 간 표현을 더 잘 정렬하고 융합하기 위해 이중 위치 인코딩을 도입한다.
  • empirical 분석을 통해 최적의 성능을 내기 위해 CLIP와 irCSN152-IG65M를 사전 훈련된 시각 및 텍스트 인코더로 선택한다.
  • 비정방형 비디오 입력을 처리하기 위한 단순하고 효과적인 방법을 적용하여 아키텍처 수정 없이 다양한 종횡비에 대한 강건성을 확보한다.
  • 대칭형 교차 엔트로피 손실과 코사인 유사도를 사용한 대비 학습을 적용하여 다중모달 매칭을 가능하게 하고, 미지의 쿼리에 대한 제로샷 일반화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1도메인 특화 적응 없이 하나의 통합 모델이 다양한 텍스트-비디오 검색 벤치마크에서 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ2약한 감독, 텍스트-이미지, 텍스트-비디오 데이터셋을 결합하면 모델의 일반화 능력과 제로샷 검색 성능에 어떤 영향을 미치는가?
  • RQ3사전 훈련된 백본의 미세조정 없이 삼단계 훈련 절차를 사용하면 지식 손실을 방지하고 전이 효율성을 향상시키는가?
  • RQ4이중 위치 인코딩이 다중모달 비디오 검색에서 다중모달 융합에 얼마나 기여하는가?
  • RQ5다양한 데이터 소스에서 훈련된 단일 모델이 개별 벤치마크에서 전문화된 모델보다 우수한 성능을 낼 수 있는가?

주요 결과

  • MDMMT-2는 MSR-VTT에서 R@1: 33.4±0.1, R@5: 60.1±0.1, R@10: 70.5±0.1, MnR: 39.2±0.2, MdR: 3.0±0.0로 새로운 최신 기술 수준 성능을 달성하며, 새로운 SOTA를 설정한다.
  • LSMDC에서 MDMMT-2는 R@1: 26.9±0.6, R@5: 46.7±0.5, R@10: 55.9±0.4, MnR: 48.0±0.5, MdR: 6.7±0.5를 기록하며, CLIP4Clip 및 CAMoE를 포함한 이전 방법들을 뛰어넘는다.
  • MSVD에서 MDMMT-2는 R@1: 56.8±0.2, R@5: 83.1±0.2, R@10: 89.2±0.1, MnR: 8.8±0.0, MdR: 1.0±0.0을 달성하여 CLIP2Video 및 QB-Norm+CLIP2Video를 크게 능가한다.
  • YouCook2에서 MDMMT-2는 R@1: 32.0±0.7, R@5: 64.0±0.3, R@10: 74.8±0.2, MnR: 12.7±0.3, MdR: 3.0±0.0을 기록하며, UniVL 및 TACo를 초월한다.
  • TGIF에서 MDMMT-2는 R@1: 25.5±0.1, R@5: 46.1±0.0, R@10: 55.7±0.1, MnR: 94.1±0.3, MdR: 7.0±0.0을 기록하여 짧고 다양한 비디오 클립에서 강력한 성능을 보여준다.
  • 모델는 도메인 간 효과적인 일반화를 보이며, 단일 훈련 런으로 다섯 개의 모든 벤치마크에서 최신 기술 수준 성능을 달성하여 다중 소스 데이터와 삼단계 훈련 전략의 효과를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.