[논문 리뷰] CUPID: Adaptive Curation of Pre-training Data for Video-and-Language Representation Learning
CUPID는 도메인 갭을 줄이기 위해 타겟 도메인과 관련된 비디오에 초점을 맞춰 사전 훈련 데이터를 필터링하는 적응형 데이터 정제 프레임워크를 제안한다. CUPID는 하류 작업과 시각적·의미적으로 유사한 소스 비디오를 선택함으로써, 텍스트-비디오 검색, 비디오 질의 응답, 비디오 캡션화에서 최신 기술 수준(SOTA) 성능을 달성한다. 이는 전체 사전 훈련 대비 최대 80% 적은 데이터와 60% 적은 훈련 스텝을 사용한다.
This work concerns video-language pre-training and representation learning. In this now ubiquitous training scheme, a model first performs pre-training on paired videos and text (e.g., video clips and accompanied subtitles) from a large uncurated source corpus, before transferring to specific downstream tasks. This two-stage training process inevitably raises questions about the generalization ability of the pre-trained model, which is particularly pronounced when a salient domain gap exists between source and target data (e.g., instructional cooking videos vs. movies). In this paper, we first bring to light the sensitivity of pre-training objectives (contrastive vs. reconstructive) to domain discrepancy. Then, we propose a simple yet effective framework, CUPID, to bridge this domain gap by filtering and adapting source data to the target data, followed by domain-focused pre-training. Comprehensive experiments demonstrate that pre-training on a considerably small subset of domain-focused data can effectively close the source-target domain gap and achieve significant performance gain, compared to random sampling or even exploiting the full pre-training dataset. CUPID yields new state-of-the-art performance across multiple video-language and video tasks, including text-to-video retrieval [72, 37], video question answering [36], and video captioning [72], with consistent performance lift over different pre-training methods.
연구 동기 및 목표
- 기존의 사전 훈련 프레임워크가 소스 데이터와 타겟 데이터 간의 도메인 갭으로 인해 도메인 간 일반화 성능이 떨어지는지 조사한다.
- 사전 훈련 모델이 도메인 외부 데이터로 이식될 때 하류 작업에서 성능 저하가 발생하는지 해결한다.
- 목표 도메인에 맞게 사전 훈련 데이터를 적응적으로 정제하는 방법을 개발하여, 전체 스케일의 사전 훈련 없이도 이식성 향상을 이룬다.
- 작은 정제된 데이터 서브셋에 집중적으로 사전 훈련하는 것이 무작위 샘플링이나 더 큰 비정제 데이터셋에 대한 전체 사전 훈련보다 성능이 뛰어나다는 것을 입증한다.
제안 방법
- CUPID는 임베딩 기반 유사도 또는 메타데이터 매칭을 사용하여 타겟 하류 데이터셋과 시각적·의미적으로 유사한 소스 비디오를 식별함으로써 대규모 소스 사전 훈련 데이터셋을 필터링한다.
- 세 가지 필터링 전략을 적용한다: 히우리스틱 매칭, 임베딩 공간 내 k-가 бли지 neighbors, 비디오 메타데이터(카테고리, 제목 등)를 사용한 평균 유사도 점수.
- 정제된 서브셋을 사용하여 대비 또는 재구성 목표를 통해 비디오-언어 모델을 사전 훈련함으로써 도메인 관련 패턴에 집중된 학습을 유도한다.
- 작은 배치 크기로 인한 성능 저하를 완화하기 위해 음성 집합을 제곱적으로 확장하는 새로운 N²-NCE 손실 함수를 도입한다.
- 비디오-언어 사전 훈련(CUPID-vlp)과 비디오 전용 사전 훈련(CUPID-clip)을 모두 지원하여 다양한 하류 작업으로의 이식을 가능하게 한다.
- 표준화된 분할과 공정한 비교를 위해 재평가된 베이스라인을 사용하여 YouCook2, TVQA, TVR, HMDB51 등의 다수 벤치마크에서 평가한다.
실험 결과
연구 질문
- RQ1소스 사전 훈련 데이터와 타겟 하류 데이터 간의 도메인 불일치가 비디오-언어 모델의 이식성에 어떤 영향을 미치는가?
- RQ2대비 목표와 재구성 목표 중 어떤 사전 훈련 목표가 도메인 갭에 더 민감한가?
- RQ3타겟 도메인과 유사한 작은 정제된 소스 데이터 서브셋이 더 큰 비정제 데이터셋에 대한 전체 사전 훈련보다 성능이 뛰어나게 되는가?
- RQ4적응형 데이터 정제가 사전 훈련 데이터와 훈련 스텝을 줄이면서 하류 작업 성능을 얼마나 향상시킬 수 있는가?
주요 결과
- CUPID는 텍스트-비디오 검색에서 새로운 SOTA 성능을 달성하였으며, 이전 SOTA 대비 R@1에서 27% 상대적 향상, R@5에서 19%, R@10에서 17% 향상되었다.
- TVR에서 CUPID는 전체 HowTo100M 사전 훈련을 사용한 SOTA 모델보다 5~14% 상대적으로 뛰어나며, 훈련 데이터의 20%와 훈련 스텝의 40%만 사용하였다.
- TVQA에서 CUPID는 테스트 정확도 74.21%를 달성하여 베이스라인 모델인 HERO(73.61%)와 최신 SOTA 방법을 모두 앞섰다.
- YouCook2 비디오 캡션화에서 CUPID-vlp는 HowTo100M에서 사전 훈련된 특징 추출기를 사용함에도 불구하고 ActBERT를 괴리스럽게 앞서는 새로운 SOTA 성능을 기록했다.
- HMDB51 행동 인식에서 CUPID-clip는 더 많은 사전 훈련 데이터와 오디오 모odal을 사용한 SOTA 방법과 비슷한 성능을 달성하여 독립적인 비디오 표현 학습의 효과성을 입증했다.
- 동일 하드웨어에서 CUPID는 사전 훈련 시간을 3주에서 6일로 단축시키면서도 성능을 유지하거나 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.