Skip to main content
QUICK REVIEW

[논문 리뷰] CUPID: Adaptive Curation of Pre-training Data for Video-and-Language Representation Learning

Luowei Zhou, Jingjing Liu|ArXiv.org|2021. 04. 01.
Multimodal Machine Learning Applications참고 문헌 71인용 수 7
한 줄 요약

CUPID는 도메인 갭을 줄이기 위해 타겟 도메인과 관련된 비디오에 초점을 맞춰 사전 훈련 데이터를 필터링하는 적응형 데이터 정제 프레임워크를 제안한다. CUPID는 하류 작업과 시각적·의미적으로 유사한 소스 비디오를 선택함으로써, 텍스트-비디오 검색, 비디오 질의 응답, 비디오 캡션화에서 최신 기술 수준(SOTA) 성능을 달성한다. 이는 전체 사전 훈련 대비 최대 80% 적은 데이터와 60% 적은 훈련 스텝을 사용한다.

ABSTRACT

This work concerns video-language pre-training and representation learning. In this now ubiquitous training scheme, a model first performs pre-training on paired videos and text (e.g., video clips and accompanied subtitles) from a large uncurated source corpus, before transferring to specific downstream tasks. This two-stage training process inevitably raises questions about the generalization ability of the pre-trained model, which is particularly pronounced when a salient domain gap exists between source and target data (e.g., instructional cooking videos vs. movies). In this paper, we first bring to light the sensitivity of pre-training objectives (contrastive vs. reconstructive) to domain discrepancy. Then, we propose a simple yet effective framework, CUPID, to bridge this domain gap by filtering and adapting source data to the target data, followed by domain-focused pre-training. Comprehensive experiments demonstrate that pre-training on a considerably small subset of domain-focused data can effectively close the source-target domain gap and achieve significant performance gain, compared to random sampling or even exploiting the full pre-training dataset. CUPID yields new state-of-the-art performance across multiple video-language and video tasks, including text-to-video retrieval [72, 37], video question answering [36], and video captioning [72], with consistent performance lift over different pre-training methods.

연구 동기 및 목표

  • 기존의 사전 훈련 프레임워크가 소스 데이터와 타겟 데이터 간의 도메인 갭으로 인해 도메인 간 일반화 성능이 떨어지는지 조사한다.
  • 사전 훈련 모델이 도메인 외부 데이터로 이식될 때 하류 작업에서 성능 저하가 발생하는지 해결한다.
  • 목표 도메인에 맞게 사전 훈련 데이터를 적응적으로 정제하는 방법을 개발하여, 전체 스케일의 사전 훈련 없이도 이식성 향상을 이룬다.
  • 작은 정제된 데이터 서브셋에 집중적으로 사전 훈련하는 것이 무작위 샘플링이나 더 큰 비정제 데이터셋에 대한 전체 사전 훈련보다 성능이 뛰어나다는 것을 입증한다.

제안 방법

  • CUPID는 임베딩 기반 유사도 또는 메타데이터 매칭을 사용하여 타겟 하류 데이터셋과 시각적·의미적으로 유사한 소스 비디오를 식별함으로써 대규모 소스 사전 훈련 데이터셋을 필터링한다.
  • 세 가지 필터링 전략을 적용한다: 히우리스틱 매칭, 임베딩 공간 내 k-가 бли지 neighbors, 비디오 메타데이터(카테고리, 제목 등)를 사용한 평균 유사도 점수.
  • 정제된 서브셋을 사용하여 대비 또는 재구성 목표를 통해 비디오-언어 모델을 사전 훈련함으로써 도메인 관련 패턴에 집중된 학습을 유도한다.
  • 작은 배치 크기로 인한 성능 저하를 완화하기 위해 음성 집합을 제곱적으로 확장하는 새로운 N²-NCE 손실 함수를 도입한다.
  • 비디오-언어 사전 훈련(CUPID-vlp)과 비디오 전용 사전 훈련(CUPID-clip)을 모두 지원하여 다양한 하류 작업으로의 이식을 가능하게 한다.
  • 표준화된 분할과 공정한 비교를 위해 재평가된 베이스라인을 사용하여 YouCook2, TVQA, TVR, HMDB51 등의 다수 벤치마크에서 평가한다.

실험 결과

연구 질문

  • RQ1소스 사전 훈련 데이터와 타겟 하류 데이터 간의 도메인 불일치가 비디오-언어 모델의 이식성에 어떤 영향을 미치는가?
  • RQ2대비 목표와 재구성 목표 중 어떤 사전 훈련 목표가 도메인 갭에 더 민감한가?
  • RQ3타겟 도메인과 유사한 작은 정제된 소스 데이터 서브셋이 더 큰 비정제 데이터셋에 대한 전체 사전 훈련보다 성능이 뛰어나게 되는가?
  • RQ4적응형 데이터 정제가 사전 훈련 데이터와 훈련 스텝을 줄이면서 하류 작업 성능을 얼마나 향상시킬 수 있는가?

주요 결과

  • CUPID는 텍스트-비디오 검색에서 새로운 SOTA 성능을 달성하였으며, 이전 SOTA 대비 R@1에서 27% 상대적 향상, R@5에서 19%, R@10에서 17% 향상되었다.
  • TVR에서 CUPID는 전체 HowTo100M 사전 훈련을 사용한 SOTA 모델보다 5~14% 상대적으로 뛰어나며, 훈련 데이터의 20%와 훈련 스텝의 40%만 사용하였다.
  • TVQA에서 CUPID는 테스트 정확도 74.21%를 달성하여 베이스라인 모델인 HERO(73.61%)와 최신 SOTA 방법을 모두 앞섰다.
  • YouCook2 비디오 캡션화에서 CUPID-vlp는 HowTo100M에서 사전 훈련된 특징 추출기를 사용함에도 불구하고 ActBERT를 괴리스럽게 앞서는 새로운 SOTA 성능을 기록했다.
  • HMDB51 행동 인식에서 CUPID-clip는 더 많은 사전 훈련 데이터와 오디오 모odal을 사용한 SOTA 방법과 비슷한 성능을 달성하여 독립적인 비디오 표현 학습의 효과성을 입증했다.
  • 동일 하드웨어에서 CUPID는 사전 훈련 시간을 3주에서 6일로 단축시키면서도 성능을 유지하거나 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.