Skip to main content
QUICK REVIEW

[논문 리뷰] Advancing High-Resolution Video-Language Representation with Large-Scale Video Transcriptions

Hongwei Xue, Tiankai Hang|arXiv (Cornell University)|2021. 11. 19.
Multimodal Machine Learning Applications참고 문헌 58인용 수 6
한 줄 요약

이 논문은 15개 유튜브 카테고리에서 유래한 371.5만 시간의 720p 영상과 1억 개의 영상-문장 쌍을 활용한 고해상도 및 다양한 영상-언어 사전학습 모델인 HD-VILA를 소개한다. 고해상도 및 저해상도 프레임을 동시에 인코딩하고 다중모달 임베딩을 종단 간 최적화하는 하이브리드 트랜스포머를 사용함으로써, HD-VILA는 최신 기준 성능을 달성하였으며, 제로샷 텍스트-비디오 검색에서 R@1 기준 40.4% 상대적 향상과 고해상도 LSMDC에서 55.4%의 성능 향상을 기록하였다.

ABSTRACT

We study joint video and language (VL) pre-training to enable cross-modality learning and benefit plentiful downstream VL tasks. Existing works either extract low-quality video features or learn limited text embedding, while neglecting that high-resolution videos and diversified semantics can significantly improve cross-modality learning. In this paper, we propose a novel High-resolution and Diversified VIdeo-LAnguage pre-training model (HD-VILA) for many visual tasks. In particular, we collect a large dataset with two distinct properties: 1) the first high-resolution dataset including 371.5k hours of 720p videos, and 2) the most diversified dataset covering 15 popular YouTube categories. To enable VL pre-training, we jointly optimize the HD-VILA model by a hybrid Transformer that learns rich spatiotemporal features, and a multimodal Transformer that enforces interactions of the learned video features with diversified texts. Our pre-training model achieves new state-of-the-art results in 10 VL understanding tasks and 2 more novel text-to-visual generation tasks. For example, we outperform SOTA models with relative increases of 40.4% R@1 in zero-shot MSR-VTT text-to-video retrieval task and 55.4% in high-resolution dataset LSMDC. The learned VL embedding is also effective in generating visually pleasing and semantically relevant results in text-to-visual editing and super-resolution tasks.

연구 동기 및 목표

  • 기존 영상-언어 사전학습 모델이 저품질 영상 특징과 제한된 텍스트 다양성에 의존하는 데서 비롯되는 한계를 해결하기 위해.
  • 고해상도(720p) 영상과 실제 유튜브 콘텐츠의 높은 다양성을 활용하여 보다 효과적인 다중모달 간 학습을 가능하게 하기 위해.
  • 시공간 영상 표현과 다중모달 언어-영상 임베딩을 종단 간 방식으로 동시에 최적화하는 통합 프레임워크를 개발하기 위해.
  • 새로운 데이터셋과 모델을 통해 고해상도, 대규모, 다양한 영상-언어 이해를 위한 새로운 벤치마크를 설정하기 위해.

제안 방법

  • 저자들은 15개의 다양한 카테고리에 걸쳐 330만 개의 720p 유튜브 영상에서 유래한 1억 개의 영상-문장 쌍을 포함한 대규모 데이터셋인 HD-VILA-100M을 수집하였다.
  • 고해상도(HR) 프레임은 무작위로, 저해상도(LR) 프레임은 시간적 위치 상 주변에서 균일하게 샘플링하는 하이브리드 이미지 시퀀스 전략을 사용하였다.
  • 하이브리드 트랜스포머 네트워크는 고해상도 및 저해상도 프레임을 별도로 인코딩하고, 이들의 특징을 공유 임베딩 공간으로 매핑하여 시공간 세부 정보와 시간적 일관성을 모두 유지한다.
  • 모델은 다중모달 트랜스포머를 활용하여 영상 및 언어 표현을 종단 간 방식으로 동시에 최적화하며, 모odal 간 풍부한 교차 어텐션을 가능하게 한다.
  • 이 프레임워크는 텍스트-비디오 검색, 영상 질의응답, 텍스트-시각 생성 등의 최종 작업으로의 제로샷 전이를 지원한다.
  • 데이터셋은 저작권 문제로 인해 원본 데이터를 공개하지 않으며, 비디오 URL과 메타데이터는 Open Use of Data Agreement 하에 공개된다.
Figure 1 : Examples of video clips and ASR generated transcriptions in the proposed HD-VILA-100M dataset. We present six samples (four frames for each), with diverse video categories covering HowTo & Style, People & Blog, Sports, Travel & Event, Pets & Animals, Film & Animation. Relevant words from
Figure 1 : Examples of video clips and ASR generated transcriptions in the proposed HD-VILA-100M dataset. We present six samples (four frames for each), with diverse video categories covering HowTo & Style, People & Blog, Sports, Travel & Event, Pets & Animals, Film & Animation. Relevant words from

실험 결과

연구 질문

  • RQ1낮은 해상도 기준선 대비 고해상도 영상 입력이 영상-언어 표현 학습에 상당한 향상을 이끌 수 있는가?
  • RQ2영상 콘텐츠의 의미적 다양성이 증가하면 영상-언어 작업의 일반화 및 성능 향상에 기여하는가?
  • RQ3시공간 영상 특징과 다중모달 임베딩을 종단 간으로 동시에 학습하는 것이 단계별 또는 이중 스트림 아키텍처를 초월할 수 있는가?
  • RQ4대규모, 다양한, 고품질의 영상-언어 데이터셋이 제로샷 및 피처샷 전이 성능 향상에 어느 정도 기여하는가?
  • RQ5고해상도(HR)와 저해상도(LR)를 조합한 제안된 하이브리드 프레임 인코딩 전략이 시각적 세부 정보와 시간적 역학을 동시에 유지하는 데 얼마나 효과적인가?

주요 결과

  • HD-VILA는 제로샷 MSR-VTT 텍스트-비디오 검색 벤치마크에서 R@1 기준 40.4% 상대적 향상을 기록하며 이전 최고 성능 모델을 초월하였다.
  • 고해상도 LSMDC 데이터셋에서 HD-VILA는 검색 성능 향상에 55.4%의 상대적 향상을 기록하여 고품질 영상 입력에 대한 강력한 일반화 능력을 입증하였다.
  • 영상 질의응답 및 캡션 생성을 포함한 10개의 영상-언어 이해 작업 전반에서 최신 기준 성능을 달성하였다.
  • 학습된 영상-언어 임베딩은 고품질의 텍스트-시각 편집 및 슈퍼레졸루션을 가능하게 하여 의미적으로 관련성 있고 시각적으로 타당한 출력을 생성하였다.
  • 371.5만 시간의 720p 영상과 15개의 다양한 카테고리를 포함한 HD-VILA-100M 데이터셋은 현재까지 가장 크고 해상도가 높은 영상-언어 데이터셋이다.
  • 모델의 성능 향상 요인은 고해상도 입력, 다양한 콘텐츠, 종단 간 다중모달 최적화의 조합에 기인한다.
Figure 2 : The distribution of categories in HD-VILA-100M dataset: (a) video, (b) video clip. [Best viewed in Color]
Figure 2 : The distribution of categories in HD-VILA-100M dataset: (a) video, (b) video clip. [Best viewed in Color]

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.