Skip to main content
QUICK REVIEW

[논문 리뷰] DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation

Susung Hong, Junyoung Seo|arXiv (Cornell University)|2023. 05. 23.
Video Analysis and Summarization인용 수 7
한 줄 요약

이 논문은 지시 프롬프트를 적용한 대규모 언어 모델(LM)을 프레임 수준의 지휘자로 사용하여 추상적 사용자 프롬프트에서 시간적으로 일관되고 스토리성 있는 영상을 생성하는 제로샷 텍스트-비디오 생성 프레임워크인 DirecT2V를 제안한다. 프롬프트를 시간에 따라 변하는 프레임 수준의 기술로 분해하고, 추가 학습 없이 회전 값 매핑과 이중 소프트맥스 필터링을 통해 T2I 확산 모델과 통합함으로써, 내러티브 일관성, 현실성, 입력 프롬프트에 대한 충실도에서 최신 기술(SOTA) 수준의 성능을 달성한다.

ABSTRACT

In the paradigm of AI-generated content (AIGC), there has been increasing attention to transferring knowledge from pre-trained text-to-image (T2I) models to text-to-video (T2V) generation. Despite their effectiveness, these frameworks face challenges in maintaining consistent narratives and handling shifts in scene composition or object placement from a single abstract user prompt. Exploring the ability of large language models (LLMs) to generate time-dependent, frame-by-frame prompts, this paper introduces a new framework, dubbed DirecT2V. DirecT2V leverages instruction-tuned LLMs as directors, enabling the inclusion of time-varying content and facilitating consistent video generation. To maintain temporal consistency and prevent mapping the value to a different object, we equip a diffusion model with a novel value mapping method and dual-softmax filtering, which do not require any additional training. The experimental results validate the effectiveness of our framework in producing visually coherent and storyful videos from abstract user prompts, successfully addressing the challenges of zero-shot video generation.

연구 동기 및 목표

  • 추상적 사용자 프롬프트에서 제로샷 텍스트-비디오 생성 시 내러티브 일관성과 시간적 일관성을 유지하는 데 도전하는 것.
  • 지시 프롬프트를 적용한 LLM이 동적인 행동과 변화하는 장면을 포괄하는 시간에 따라 변하는 프레임 수준의 기술을 생성할 잠재력을 탐색하는 것.
  • 모듈레이션된 자체 어텐션 메커니즘을 사용하여 확산 기반 비디오 생성에서 시간적 일관성을 향상시키는 트레이닝 없는 방법을 개발하는 것.
  • LLM을 통한 프롬프트 분해를 통해 화면 간격 및 총 지속 시간과 같은 비디오 속성 제어를 가능하게 하는 것.

제안 방법

  • 지시 프롬프트를 적용한 LLM(예: GPT-4)을 사용하여 단일 추상적 사용자 프롬프트를 정적 및 동적 요소로 분리된 프레임 단위 기술로 분해한다.
  • 회전 값 매핑(RVM)을 도입하여 각 확산 타임스텝에서 참조 프레임을 적응적으로 선택하고 어텐션 값을 전파함으로써, 프레임 간에 동적인 콘텐츠 전파를 가능하게 한다.
  • 이중 소프트맥스 필터링(DSF)을 사용하여 자체 어텐션 레이어에서 신뢰도 마스크를 계산하고, 신뢰할 수 없는 값 매핑을 걸러내며 잘못된 프레임 간 어텐션을 줄인다.
  • 추가적인 펌웨어 트레이닝 없이 사전 학습된 텍스트-이미지 확산 모델(예: Stable Diffusion)에 이러한 메커니즘을 통합한다.
  • 고해상도 비디오 생성 시 배치 크기 제한을 처리하기 위해 캐싱 메커니즘을 사용한다.
  • 재귀적 프롬프트 분할을 통해 화면 간격 및 총 지속 시간과 같은 비디오 속성을 제어하기 위해 프롬프트 엔지니어링을 적용한다.
Figure 1: Overall pipeline of our DirecT2V framework. DirecT2V consists of two parts: directing an abstract user prompt with an LLM director ( e.g. , GPT-4 (OpenAI, 2023 ) ) and video generation with a T2I diffusion ( e.g. , Stable Diffusion (Rombach et al., 2022 ) ) equipped with modulated self-att
Figure 1: Overall pipeline of our DirecT2V framework. DirecT2V consists of two parts: directing an abstract user prompt with an LLM director ( e.g. , GPT-4 (OpenAI, 2023 ) ) and video generation with a T2I diffusion ( e.g. , Stable Diffusion (Rombach et al., 2022 ) ) equipped with modulated self-att

실험 결과

연구 질문

  • RQ1지시 프롬프트를 적용한 LLM은 단일 추상적 텍스트 프롬프트에서 비디오 생성을 위한 시간에 따라 변하는 프레임 수준의 기술을 효과적으로 생성할 수 있는가?
  • RQ2확산 모델의 파라미터를 미세조정하지 않고 제로샷 텍스트-비디오 생성에서 시간적 일관성을 어떻게 향상시킬 수 있는가?
  • RQ3회전 값 매핑과 이중 소프트맥스 필터링은 잘못된 어텐션 매핑을 어느 정도 줄이고 시각적 일관성을 향상시킬 수 있는가?
  • RQ4LLM을 통한 프롬프트 분해를 통해 화면 간격 및 지속 시간과 같은 비디오 속성 제어가 가능한가?

주요 결과

  • 사용자 연구에서 DirecT2V는 사용자 프롬프트에 대한 충실도가 90.48%를 기록하여 SOTA 기준선(T2V-Z)의 9.52%보다 유의미하게 높게 성과를 냈다.
  • 인간 평가에서 모델은 현실성 93.45%와 내러티브 품질 92.86%를 기록하여 뛰어난 시각적 일관성과 스토리 일관성을 입증했다.
  • 아블레이션 연구에서 RVM이 없을 경우, 번개가 치는 폭풍이나 달리는 사자와 같은 변화하는 장면을 제대로 묘사하지 못하는 것으로 나타났다.
  • 이중 소프트맥스 필터링은 눈이 한 프레임에서 다른 프레임으로 잘못 매핑되는 등의 잘못된 어텐션 매핑을 효과적으로 방지하여 시각적 잡음을 줄였다.
  • LLM을 재귀적으로 프롬프트하여 프레임을 분할함으로써 고화면 비디오 생성이 가능해졌고, 배치 크기 제한을 초월한 생성이 가능했다.
  • 제안된 방법은 추가 트레이닝 없이도 높은 성능을 유지하며, 오직 프롬프트 엔지니어링과 어텐션 메커니즘 수정에 의존한다.
Figure 2: Zero-shot video generation. DirecT2V, using LLMs as frame-level directors, enables zero-shot narrative text-to-video generation, while current zero-shot ( e.g. , Text2Video-Zero (Khachatryan et al., 2023 ) ) or tuned ( e.g. , CogVideo (Hong et al., 2022 ) ) baselines do not contain high-le
Figure 2: Zero-shot video generation. DirecT2V, using LLMs as frame-level directors, enables zero-shot narrative text-to-video generation, while current zero-shot ( e.g. , Text2Video-Zero (Khachatryan et al., 2023 ) ) or tuned ( e.g. , CogVideo (Hong et al., 2022 ) ) baselines do not contain high-le

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.