Skip to main content
QUICK REVIEW

[논문 리뷰] GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions

Chenfei Wu, Lun Huang|arXiv (Cornell University)|2021. 04. 30.
Multimodal Machine Learning Applications참고 문헌 31인용 수 78
한 줄 요약

GODIVA는 VQ-VAE를 이용하고 3차원 희소 어텐션 기제를 가진 텍스트-비디오 프리트레인 모델로, Howto100M에서 프리트레인되고 새로운 Relative Matching 지표로 평가된 오픈도메인 비디오를 자연어 설명으로 생성합니다.

ABSTRACT

Generating videos from text is a challenging task due to its high computational requirements for training and infinite possible answers for evaluation. Existing works typically experiment on simple or small datasets, where the generalization ability is quite limited. In this work, we propose GODIVA, an open-domain text-to-video pretrained model that can generate videos from text in an auto-regressive manner using a three-dimensional sparse attention mechanism. We pretrain our model on Howto100M, a large-scale text-video dataset that contains more than 136 million text-video pairs. Experiments show that GODIVA not only can be fine-tuned on downstream video generation tasks, but also has a good zero-shot capability on unseen texts. We also propose a new metric called Relative Matching (RM) to automatically evaluate the video generation quality. Several challenges are listed and discussed as future work.

연구 동기 및 목표

  • 자연어 설명에서 의미적으로 일관된 비디오를 생성하는 도전 과제 해결.
  • 비디오 토큰 생성을 위해 시간적, 행, 열 관계를 효율적으로 모델링하기 위한 3차원 희소 어텐션 메커니즘 제안.
  • 자 autoregressive 생성에 대해 비디오를 이산 토큰으로 매핑하는 VQ-VAE 기반 프레임워크 도입.
  • 대규모 텍스트-비디오 데이터셋(Howto100M)에서 프리트레인하고 실제 및 합성 벤치마크에서 평가.
  • 비디오를 텍스트와 비교 자동 평가하는 상대 메트릭(Relative Matching) 개발.

제안 방법

  • 비디오 프레임을 이산 토큰으로 인코딩하고 그러한 토큰으로부터 프레임을 재구성하기 위해 VQ-VAE 오토인코더 사용.
  • 텍스트 임베딩과 이산 비디오 토큰을 소비하는 자기회귀 생성기로 P(z|t) 모델링.
  • Temporal, Row, Column 구성요소가 있는 3차원 희소 어텐션을 적용해 제곱 복잡도를 거의 선형으로 감소.
  • 다음 시각적 토큰을 시퀀스에서 예측하기 위해 크로스엔트로피 손실로 학습.
  • Howto100M에서 프리트레인하고 MSR-VTT에서 파인튜닝; 필요시 CLIP 기반 랭킹 적용해 RM 점수 향상.

실험 결과

연구 질문

  • RQ1GODIVA가 자연어 설명으로 일관된 오픈 도메인 비디오를 생성할 수 있는가?
  • RQ23차원 희소 어텐션 메커니즘이 텍스트-비디오 생성을 효율적이고 확장 가능하게 하는가?
  • RQ3보지 못한 텍스트로의 전달(제로샷) 및 다운스트림 데이터셋으로의 파인튜닝은 어떤가?

주요 결과

  • GODIVA는 텍스트로 의미적으로 일관된 비디오를 생성할 수 있으며 보지 못한 설명으로 제로샷 생성을 지원한다.
  • 3차원 희소 어텐션은 제곱 복잡도를 거의 선형으로 줄이면서도 성능을 유지한다.
  • 새로운 Relative Matching (RM) 지표가 실험 전반에서 의미적 정렬 및 시각적 품질과 상관관계가 있다.
  • Row Attention의 Ablation이 성능에 특히 중요함을 보여주며 CLIP 랭킹이 RM을 더 높인다.
  • Howto100M에서 프리트레인하면 MSR-VTT에서의 파인튜닝과 제로샷 결과가 효과적으로 나타난다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.