Skip to main content
QUICK REVIEW

[論文レビュー] DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation

Susung Hong, Junyoung Seo|arXiv (Cornell University)|May 23, 2023
Video Analysis and Summarization被引用数 7
ひとこと要約

本論文は、指示微調整を施した大規模言語モデル(LLM)をフレーム単位のディレクターとして用い、抽象的なユーザーのプロンプトから時間的に整合性があり物語的な動画を生成するゼロショットテキストtoビデオ生成フレームワークであるDirecT2Vを提案する。プロンプトを時間的に変化するフレーム単位の記述に分解し、回転値マッピングとデュアルソフトマックスフィルタリングを用いてT2I拡散モデルと統合することで、追加の訓練を一切行わず、物語の一貫性、現実性、入力プロンプトへの忠実度において最先端の性能を達成する。

ABSTRACT

In the paradigm of AI-generated content (AIGC), there has been increasing attention to transferring knowledge from pre-trained text-to-image (T2I) models to text-to-video (T2V) generation. Despite their effectiveness, these frameworks face challenges in maintaining consistent narratives and handling shifts in scene composition or object placement from a single abstract user prompt. Exploring the ability of large language models (LLMs) to generate time-dependent, frame-by-frame prompts, this paper introduces a new framework, dubbed DirecT2V. DirecT2V leverages instruction-tuned LLMs as directors, enabling the inclusion of time-varying content and facilitating consistent video generation. To maintain temporal consistency and prevent mapping the value to a different object, we equip a diffusion model with a novel value mapping method and dual-softmax filtering, which do not require any additional training. The experimental results validate the effectiveness of our framework in producing visually coherent and storyful videos from abstract user prompts, successfully addressing the challenges of zero-shot video generation.

研究の動機と目的

  • 抽象的なユーザーのプロンプトからゼロショットテキストtoビデオ生成において物語の一貫性と時間的整合性を維持する課題に対処すること。
  • 指示微調整を施したLLMが、動的な行動や変化するシーンを捉える時間的に変化するフレーム単位の記述を生成する可能性を調査すること。
  • 微調整なしに、調整可能な自己アテンションメカニズムを用いて拡散ベースのビデオ生成における時間的整合性を向上させる方法を開発すること。
  • LLMガイドドのプロンプト分解を用いて、フレームレートや継続時間などのビデオ属性を制御できることを実現すること。

提案手法

  • GPT-4などの指示微調整を施したLLMを活用し、単一の抽象的なユーザーのプロンプトをフレームごとの記述に分解し、静的要素と動的要素を分離する。
  • 回転値マッピング(RVM)を導入し、各拡散ステップで適応的に参照フレームを選択することで、アテンション値をフレーム間で効果的に伝搬させ、動的なコンテンツ伝搬を可能にする。
  • デュアルソフトマックスフィルタリング(DSF)を用い、自己アテンション層から信頼性マスクを計算し、信頼性の低い値マッピングをフィルタリングすることで、誤ったフレーム間アテンションを低減する。
  • 微調整や追加学習を一切行わず、事前学習済みのテキストto画像拡散モデル(例:Stable Diffusion)にこれらのメカニズムを統合する。
  • 高フレームレートの動画生成時にバッチサイズ制限に対処するためのキャッシュ機構を導入する。
  • 繰り返しプロンプトを生成することで、フレームレートや総継続時間といったビデオ属性を制御可能なように、プロンプト工学を適用する。
Figure 1: Overall pipeline of our DirecT2V framework. DirecT2V consists of two parts: directing an abstract user prompt with an LLM director ( e.g. , GPT-4 (OpenAI, 2023 ) ) and video generation with a T2I diffusion ( e.g. , Stable Diffusion (Rombach et al., 2022 ) ) equipped with modulated self-att
Figure 1: Overall pipeline of our DirecT2V framework. DirecT2V consists of two parts: directing an abstract user prompt with an LLM director ( e.g. , GPT-4 (OpenAI, 2023 ) ) and video generation with a T2I diffusion ( e.g. , Stable Diffusion (Rombach et al., 2022 ) ) equipped with modulated self-att

実験結果

リサーチクエスチョン

  • RQ1指示微調整を施したLLMは、1つの抽象的なテキストプロンプトから、動画生成に適した時間的に変化するフレーム単位の記述を効果的に生成できるか?
  • RQ2拡散モデルの微調整なしに、ゼロショットテキストtoビデオ生成における時間的整合性をどのように向上させられるか?
  • RQ3回転値マッピングとデュアルソフトマックスフィルタリングは、誤ったアテンションマッピングをどれほど低減させ、視覚的一致性を向上させられるか?
  • RQ4LLMガイドドのプロンプト分解により、フレームレートや継続時間といったビデオ属性の制御が可能になるか?

主な発見

  • ユーザー評価では、DirecT2Vはユーザーのプロンプトへの忠実度が90.48%に達し、SOTAベースライン(T2V-Z)の9.52%を大きく上回った。
  • 人間による評価では、リアルさが93.45%、物語的質が92.86%を記録し、優れた視覚的整合性と物語的一致性を示した。
  • アブレーションスタディの結果、回転値マッピングがなければ、雷雨の発展や走るシマウマの描写といった進化するシーンを正しく再現できなかった。
  • デュアルソフトマックスフィルタリングは、誤ったアテンションマッピング(例:1フレームの目を別のフレームにマッピングするなど)を効果的に防止し、視覚的アーチファクトを低減した。
  • LLMによる再帰的プロンプト分割を用いることで、バッチサイズの制限を超えて高フレームレートの動画を生成するのに成功した。
  • 提案手法は微調整を一切行わず、プロンプト工学とアテンションメカニズムの変更に依存するだけで、高い性能を維持した。
Figure 2: Zero-shot video generation. DirecT2V, using LLMs as frame-level directors, enables zero-shot narrative text-to-video generation, while current zero-shot ( e.g. , Text2Video-Zero (Khachatryan et al., 2023 ) ) or tuned ( e.g. , CogVideo (Hong et al., 2022 ) ) baselines do not contain high-le
Figure 2: Zero-shot video generation. DirecT2V, using LLMs as frame-level directors, enables zero-shot narrative text-to-video generation, while current zero-shot ( e.g. , Text2Video-Zero (Khachatryan et al., 2023 ) ) or tuned ( e.g. , CogVideo (Hong et al., 2022 ) ) baselines do not contain high-le

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。