Skip to main content
QUICK REVIEW

[논문 리뷰] CREATE: A Benchmark for Chinese Short Video Retrieval and Title Generation

Ziqi Zhang, Yuxin Chen|arXiv (Cornell University)|2022. 03. 31.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 51개 카테고리에 걸쳐 210만 건의 정밀 레이블링된 영상과 1,000만 건의 약한 레이블링된 영상로 구성된 중국어 단편 영상 검색 및 제목 생성을 위한 최초의 대규모 벤치마크인 CREATE를 소개한다. 이는 태그 기반 융합과 GPT 디코더를 사용하는 비전-언어 모델인 ALWIG를 제안하여 영상 검색과 제목 생성을 동시에 최적화하며, 기준 모델 대비 영상 제목 생성에서 CIDEr 점수를 62.5% 향상시켰다.

ABSTRACT

Previous works of video captioning aim to objectively describe the video's actual content, which lacks subjective and attractive expression, limiting its practical application scenarios. Video titling is intended to achieve this goal, but there is a lack of a proper benchmark. In this paper, we propose to CREATE, the first large-scale Chinese shoRt vidEo retrievAl and Title gEneration benchmark, to facilitate research and application in video titling and video retrieval in Chinese. CREATE consists of a high-quality labeled 210K dataset and two large-scale 3M/10M pre-training datasets, covering 51 categories, 50K+ tags, 537K manually annotated titles and captions, and 10M+ short videos. Based on CREATE, we propose a novel model ALWIG which combines video retrieval and video titling tasks to achieve the purpose of multi-modal ALignment WIth Generation with the help of video tags and a GPT pre-trained model. CREATE opens new directions for facilitating future research and applications on video titling and video retrieval in the field of Chinese short videos.

연구 동기 및 목표

  • 소셜 미디어 및 콘텐츠 제작 분야에서 실용적으로 응용되기 위한 필수 요소인 중국어 단편 영상 제목 생성 및 검색을 위한 대규모 고품질 벤치마크의 부족 문제를 해결하기 위해.
  • 실제 사용자 참여 수요를 반영하는 데이터셋을 구축함으로써 객관적인 영상 요약과 주관적이고 클릭 유도적인 제목 스타일 영상 제목 사이의 격차를 메우기 위해.
  • 시각-언어 정렬 및 생성 능력을 활용하여 영상 검색과 제목 생성을 동시에 최적화하는 통합 모델을 개발하기 위해.
  • 세분화된 태그, 제목, 캡션을 포함한 풍부한 애너테이션을 제공함으로써 향후 중국어 다중 모odal 이해 분야의 연구 기반을 마련하기 위해.

제안 방법

  • CREATE는 21만 건의 정밀 레이블링된 영상(비디오) 데이터셋(CREATE-210K)과 사전 훈련을 위한 대규모 약한 레이블링된 두 개의 데이터셋(CREATE-3M/10M)으로 구성된다.
  • 모델 ALWIG는 수동으로 캐리어된 고품질의 영상 태그를 사용하여 시각적 특징과 텍스트 표현 간의 정렬을 수행하는 태그 기반 융합 모듈을 활용한다.
  • GPT 기반 디코더를 사용하여 언어 다양성이 높고 표현력 있는 클릭 유도형 제목을 생성할 수 있도록 한다.
  • 두 개의 스트림 BERT 인코더를 사용해 시각적 및 텍스트적 특징을 추출한 후, 교차 어텐션 융합을 수행하고 별도의 디코더를 통해 생성 작업을 수행한다.
  • 대규모 약한 레이블링된 1,000만 건의 영상 데이터를 사용해 대조 학습 목표를 통해 사전 훈련을 수행함으로써 시각과 언어 표현 간의 정렬을 도모한다.
  • 프레임워크는 추론 시 빔 서치를 사용하며, 검색(Recall@K 기반) 및 생성(BLEU-4, CIDEr, Rouge-L 기반) 작업을 모두 지원한다.

실험 결과

연구 질문

  • RQ1실제 응용 수요를 반영하는 중국어 단편 영상 검색 및 제목 생성을 위한 대규모 고품질 벤치마크를 어떻게 구성할 수 있는가?
  • RQ2비전-언어 모델에서 영상 태그가 시각적 모odal과 텍스트 모달 간의 다중 모달 정렬을 위해 얼마나 효과적인 다리 역할을 할 수 있는가?
  • RQ3영상 검색과 제목 생성을 동시에 최적화하는 것이 단일 작업 기반 베이스라인 대비 두 작업의 성능을 향상시킬 수 있는가?
  • RQ4표준 순차 생성 헤드에 비해 GPT 기반 디코더는 얼마나 다양한, 매력적인, 맥락적으로 관련된 영상 제목을 생성하는 데 효과적인가?

주요 결과

  • ALWIG는 UniVL 기준 모델 대비 영상 제목 생성 작업에서 CIDEr 점수를 62.5% 상승시켜 태그 기반 융합과 GPT 기반 생성의 효과성을 입증했다.
  • 태그 기반 융합 모듈을 제거할 경우 영상 제목 생성에서 CIDEr 점수는 56% 감소하고 캡션 생성에서는 56.8% 감소하여, 이 모듈이 의미 정렬에 핵심적인 역할을 한다는 것을 확인했다.
  • GPT 디코더를 제거할 경우 영상 제목 생성에서 BLEU-4 점수는 34.4% 감소하고 캡션 생성에서는 14.1% 감소하여, 유창하고 다양한 문장 패턴을 학습하는 데 있어 이 디코더의 중요성을 입증했다.
  • 사전 훈련 없이 학습한 모델은 모든 지표에서 유의미하게 열등한 성능을 보였으며, 이는 대규모 약한 레이블링된 데이터를 활용한 사전 훈련의 유용성을 입증한다.
  • 제안된 벤치마크인 CREATE는 21만 건의 영상과 53.7만 건의 수동 애너테이션된 제목 및 캡션, 5만 건 이상의 세분화된 태그를 포함하고 있으며, 애너테이션 규모에서 VATEX 대비 5.23배, T-VTD 대비 2.98배 더 크다.
  • ALWIG는 영상 검색, 영상 제목 생성, 캡션 생성의 세 가지 작업 전반에서 OSCAR 및 UniVL를 모두 압도하며, 통합 학습에서의 우수성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.