Skip to main content
QUICK REVIEW

[논문 리뷰] CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers

Wenyi Hong, Ming Ding|arXiv (Cornell University)|2022. 05. 29.
Human Pose and Action Recognition인용 수 116
한 줄 요약

CogVideo는 오픈 도메인 텍스트-비디오 생성을 위한 9.4B 파라미터 트랜스포머입니다. 이것은 다중 프레임 레이트 계층적 학습 전략과 이중 채널 어텐션으로 CogView2를 파인튜닝하여 공개 모델 중에서 최첨단 성능을 달성합니다.

ABSTRACT

Large-scale pretrained transformers have created milestones in text (GPT-3) and text-to-image (DALL-E and CogView) generation. Its application to video generation is still facing many challenges: The potential huge computation cost makes the training from scratch unaffordable; The scarcity and weak relevance of text-video datasets hinder the model understanding complex movement semantics. In this work, we present 9B-parameter transformer CogVideo, trained by inheriting a pretrained text-to-image model, CogView2. We also propose multi-frame-rate hierarchical training strategy to better align text and video clips. As (probably) the first open-source large-scale pretrained text-to-video model, CogVideo outperforms all publicly available models at a large margin in machine and human evaluations.

연구 동기 및 목표

  • 텍스트와 텍스트-이미지 도메인을 넘어 대규모 사전학습 트랜스포머를 활용한 텍스트-비디오 생성을 촉진한다.
  • 전체 from-scratch 사전학습 없이도 비디오 생성을 촉진하기 위해 사전학습된 텍스트-이미지 지식을 활용한다.
  • 텍스트를 시간적 비디오 의미와 정렬하기 위한 다중 프레임 레이트 계층적 학습 전략을 제안한다.
  • 이미지 모델의 지식을 비디오 생성에 효율적으로 통합하기 위한 이중 채널 어텐션 메커니즘을 개발한다.

제안 방법

  • 9.4B 파라미터 트랜스포머로 텍스트-비디오 생성을 위해 사전학습된 CogView2 텍스트-이미지 모델을 파인튜닝한다.
  • 프레임 레이트 토큰을 도입하고 계단식 생성(일련의 주요 프레임 → 프레임 보간)을 통해 텍스트 프롬프트를 프레임과 정렬하기 위한 다중 프레임 레이트 계층적 학습을 도입한다.
  • CogView2 파라미터를 고정하고 추가된 시간-공간 어텐션 채널(attention-plus)만 학습시켜 이미지-비디오 모델링을 융합하는 이중 채널 어텐션 블록을 활용한다.
  • 메모리 비용을 줄이고 부분 병렬화를 가능하게 하기 위해 자기회귀 생성으로 확장된 Shifted Window(Swin) 어텐션을 적용한다.
  • 보간을 위한 양방향 문맥을 허용하되 autoregressive 프레임 생성을 유지하기 위해 CogLM-스타일의 양방향/단방향 마스킹을 사용한다.

실험 결과

연구 질문

  • RQ1기존의 텍스트-이미지 사전학습 모델을 활용하여 개방 도메인 텍스트-비디오 생성을 어떻게 강력한 성능으로 달성할 수 있는가?
  • RQ2다중 프레임 레이트 계층적 학습 전략이 텍스트-비디오 정렬 및 모션 의미를 향상시키는가?
  • RQ3이중 채널 어텐션 메커니즘이 전체 재훈련 없이도 이미지-언어 지식을 비디오 생성으로 효과적으로 이전할 수 있는가?
  • RQ4Shifted Window 어텐션이 자기회귀 비디오 생성의 효율성에 어떤 영향을 미치는가?

주요 결과

  • CogVideo는 공개적으로 이용 가능한 텍스트-비디오 모델 중 UCF-101 및 Kinetics-600에서 질적 및 정량적 성능 면에서 최첨단에 도달한다.
  • 계층적 다중 프레임 레이트 생성은 단일 단계 생성에 비해 텍스트-비디오 정렬 및 모션 의미를 향상시킨다.
  • CogView2를 이중 채널 어텐션(attention-plus)으로 파인튜닝하는 것이 처음부터 학습하거나 무작위 초기화를 사용하는 것보다 더 나은 결과를 낸다. CogView2 파라미터는 고정된 상태로 유지한다.
  • Shifted Window 어텐션은 자기회귀 비디오 생성에서 부분 프레임 수준 병렬화를 가능하게 하여 추론 속도를 높인다.
  • 인간 평가에서 CogVideo가 프레임 질감, 모션 리얼리즘, 의미 관련성 측면에서 베이스라인을 능가하는 것으로 나타났다.
  • 삭제 연구는 계층적 접근 방식과 CogView2로 초기화된 모델이 무작위 초기화보다 우수하다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.