Skip to main content
QUICK REVIEW

[논문 리뷰] Youku-mPLUG: A 10 Million Large-scale Chinese Video-Language Dataset for Pre-training and Benchmarks

Haiyang Xu, Qinghao Ye|arXiv (Cornell University)|2023. 06. 07.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

Youku-mPLUG는 유튜브에서 수집한 1000만 개의 고품질 영상-텍스트 쌍을 포함한 가장 큰 공개 가능한 중국어 영상-언어 사전학습 데이터셋과 함께, 영상-텍스트 검색, 캡셔닝, 분류를 위한 포괄적인 인간 주석 기반 벤치마크를 제공한다. 이 데이터셋으로 사전학습을 수행하면 최신 기술 수준의 성능을 달성할 수 있으며, 영상 분류 정확도가 23.1% 향상되고 mPLUG-video 모델이 80.5%의 top-1 정확도를 기록한다.

ABSTRACT

To promote the development of Vision-Language Pre-training (VLP) and multimodal Large Language Model (LLM) in the Chinese community, we firstly release the largest public Chinese high-quality video-language dataset named Youku-mPLUG, which is collected from Youku, a well-known Chinese video-sharing website, with strict criteria of safety, diversity, and quality. Youku-mPLUG contains 10 million Chinese video-text pairs filtered from 400 million raw videos across a wide range of 45 diverse categories for large-scale pre-training. In addition, to facilitate a comprehensive evaluation of video-language models, we carefully build the largest human-annotated Chinese benchmarks covering three popular video-language tasks of cross-modal retrieval, video captioning, and video category classification. Youku-mPLUG can enable researchers to conduct more in-depth multimodal research and develop better applications in the future. Furthermore, we release popular video-language pre-training models, ALPRO and mPLUG-2, and our proposed modularized decoder-only model mPLUG-video pre-trained on Youku-mPLUG. Experiments show that models pre-trained on Youku-mPLUG gain up to 23.1% improvement in video category classification. Besides, mPLUG-video achieves a new state-of-the-art result on these benchmarks with 80.5% top-1 accuracy in video category classification and 68.9 CIDEr score in video captioning, respectively. Finally, we scale up mPLUG-video based on the frozen Bloomz with only 1.7% trainable parameters as Chinese multimodal LLM, and demonstrate impressive instruction and video understanding ability. The zero-shot instruction understanding experiment indicates that pretraining with Youku-mPLUG can enhance the ability to comprehend overall and detailed visual semantics, recognize scene text, and leverage open-domain knowledge.

연구 동기 및 목표

  • 비디오-언어 사전학습(VLP) 및 다중모달 LLM 개발을 저해하는 대규모 고품질 공개 중국어 영상-언어 데이터셋의 부족 문제를 해결하기 위해.
  • 현재 중국어에서 영상-언어 모델 평가를 위한 표준화된 공개 벤치마크가 부족하여 공정한 비교와 재현 가능성이 제한되고 있는 문제를 해결하기 위해.
  • 엄격한 필터링과 데이터 정제를 통해 다양하고 안전하며 고품질인 데이터셋을 제공함으로써 중국어 다중모달 AI의 더 효과적인 사전학습 및 후속 응용 개발을 가능하게 하기 위해.
  • Youku-mPLUG로 사전학습된 새로운 모odu러식 디코더 전용 아키텍처(mPLUG-video)를 포함한 고급 다중모달 모델을 훈련하기 위한 기반을 마련하기 위해.
  • 중국어 특화 데이터로 사전학습을 수행함으로써 제로샷 지시 이해 및 후속 작업에서의 성능 향상이 뚜렷하게 나타나는 것을 입증하기 위해.

제안 방법

  • Youku는 주요 중국어 영상 공유 플랫폼으로, 4억 개의 원시 영상에서 데이터를 수집하였으며, 다수의 위험 감지 수준과 수동 총괄을 통해 안전성, 다양성, 품질을 철저히 필터링하였다.
  • 45개의 다양한 카테고리에서 1000만 개의 영상-텍스트 쌍을 선별하였으며, 텍스트 및 영상 수준의 정제와 중국어 이미지-텍스트 사전학습 모델을 활용하여 균형 잡힌 분포와 고품질을 확보하였다.
  • 영상-텍스트 검색, 영상 캡처링, 영상 분류를 위한 세 가지 작업을 수행하기 위해 365,000개의 영상으로 구성된 인간 주석 기반 벤치마크를 구축하였다. 이는 종합적인 평가를 가능하게 한다.
  • 영상-언어 이해력과 추론 능력을 향상시키기 위해 Youku-mPLUG로 사전학습된 새로운 모듈러식 디코더 전용 모델인 mPLUG-video를 제안하였다.
  • 오직 1.7%의 학습 가능한 파rameter만을 사용하여 냉각된 Bloomz 백본을 확장함으로써 중국어 다중모달 LLM을 구축하였으며, 강력한 제로샷 지시 따르기 능력을 확보하였다.
  • 평가에는 인간 주석 기반의 제로샷 지시 이해 테스트가 포함되었으며, mPLUG-video를 VideoLLaMA 및 사전학습되지 않은 mPLUG-Video와 비교하였다.

실험 결과

연구 질문

  • RQ1대규모 고품질 중국어 영상-언어 데이터셋은 후속 작업에서 영상-언어 모델의 성능을 크게 향상시킬 수 있는가?
  • RQ2Youku-mPLUG로 사전학습을 수행할 경우, 특히 시각적 의미, 장면 텍스트, 오픈 도메인 지식을 인식하는 데 있어 제로샷 영상 지시 이해 능력이 어느 정도 향상되는가?
  • RQ3영상과 언어 간의 모odal 상호보완성이 영상-언어 모델의 검색 성능에 어떤 영향을 미치는가?
  • RQ4Youku-mPLUG로 사전학습된 디코더 전용 아키텍처가 영상 분류 및 캡처링에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5문화적·언어적으로 특화된 데이터셋인 Youku-mPLUG로 사전학습을 수행할 경우, 중국어 시각적·언어적 개념에 대한 일반화 및 이해 능력이 향상되는가?

주요 결과

  • Youku-mPLUG로 사전학습된 모델은 기준 모델 대비 영상 분류 정확도에서 23.1% 향상된 성능을 기록하였다.
  • mPLUG-video 모델은 영상 분류에서 80.5%의 top-1 정확도와 캡처링에서 68.9 CIDEr 점수를 기록하며 새로운 최고 기록을 수립하였다.
  • 인간 평가 결과, mPLUG-video는 제로샷 지시 이해에서 VideoLLaMA 및 사전학습되지 않은 mPLUG-Video를 능가하며, 정확하고 만족스러운 응답(A등급) 비율이 높았다.
  • 모델는 '점프하기'나 '비틀기'와 같은 행동과 같은 세밀한 시각적 의미를 이해하는 데 뛰어난 능력을 보였다.
  • 영상 내에서 장면 텍스트를 정확히 인식하는 능력이 향상되었으며, 다른 모델이 실패하는 상황에서도 '우르트라맨'과 같은 주요 캐릭터를 정확히 식별하였다.
  • Youku-mPLUG로 사전학습을 수행함으로써 모델는 전체 영상 의미, 세부 시각적 신호, 중국어의 언어적 뉘앙스를 이해하는 능력이 크게 향상됨을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.