Skip to main content
QUICK REVIEW

[論文レビュー] StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text

Roberto Henschel, Levon Khachatryan|arXiv (Cornell University)|Mar 21, 2024
Video Analysis and Summarization被引用数 4
ひとこと要約

StreamingT2V は、短時間記憶用の条件付きアテンションモジュール(CAM)と長時間記憶用の外見保持モジュール(APM)を導入することで、高品質で一貫性があり、動的な長時間の動画生成(最大1200フレーム)を可能にする自己回帰的テキストto動画拡散モデルです。これにより、滑らかな遷移と最小限の動画停止が保証されます。運動の一貫性と時間的整合性において最先端の性能を達成し、MAWE や SCuts といった主要指標において、既存の手法を上回っています。

ABSTRACT

Text-to-video diffusion models enable the generation of high-quality videos that follow text instructions, making it easy to create diverse and individual content. However, existing approaches mostly focus on high-quality short video generation (typically 16 or 24 frames), ending up with hard-cuts when naively extended to the case of long video synthesis. To overcome these limitations, we introduce StreamingT2V, an autoregressive approach for long video generation of 80, 240, 600, 1200 or more frames with smooth transitions. The key components are:(i) a short-term memory block called conditional attention module (CAM), which conditions the current generation on the features extracted from the previous chunk via an attentional mechanism, leading to consistent chunk transitions, (ii) a long-term memory block called appearance preservation module, which extracts high-level scene and object features from the first video chunk to prevent the model from forgetting the initial scene, and (iii) a randomized blending approach that enables to apply a video enhancer autoregressively for infinitely long videos without inconsistencies between chunks. Experiments show that StreamingT2V generates high motion amount. In contrast, all competing image-to-video methods are prone to video stagnation when applied naively in an autoregressive manner. Thus, we propose with StreamingT2V a high-quality seamless text-to-long video generator that outperforms competitors with consistency and motion. Our code will be available at: https://github.com/Picsart-AI-Research/StreamingT2V

研究の動機と目的

  • 時間的不整合や動画停止のため、従来のテキストto動画拡散モデルが長時間の一貫性のある動画を生成できないという限界を解消すること。
  • 短時間動画モデルを長時間シーケンスに拡張する際の運動ダイナミクスと外見の一貫性の低下を克服すること。
  • 長時間の動画生成にわたり、高レベルのシーンやオブジェクト特徴を維持する記憶拡張型自己回帰フレームワークを設計すること。
  • チャンク化のアーチファクトを引き起こさずに、自己回帰的生成に動画強化モデルをシームレスに統合できること。
  • さまざまな入力解像度やモデルアーキテクチャに強く、高品質で拡張可能な動画生成を達成すること。

提案手法

  • 直前の動画チャンクからの特徴を条件として用いるアテンションメカニズムを用いた条件付きアテンションモジュール(CAM)を導入し、現在の動画生成を滑らかに保証する。
  • 最初の動画フレームから高レベルのシーンおよびオブジェクト特徴を抽出・保持する外見保持モジュール(APM)を採用し、時間経過に伴う外見のずれを防止する。
  • 別個の動画強化器を自己回帰パイプラインに組み込む際、重複する部分をランダムにブレンドする戦略を適用し、滑らかな統合を実現する。
  • 長期間にわたる外見の一貫性を確保するため、固定アンカーフレームを基準として用いることで、CLIPベースの条件付けに起因するドメインシフトの問題を軽減する。
  • SDEdit手法を自己回帰的動画強化に適応し、24フレームの重複を持つチャンクに適用し、ランダムブレンドを用いることで時間的不整合を回避する。
  • さまざまなベーステキストto動画モデルと互換性があり、将来的により優れたベースモデルへのアップグレードが可能となるようにフレームワークを設計する。

実験結果

リサーチクエスチョン

  • RQ1動画停止やシーンチェンジを引き起こさずに、長時間の動画シーケンスにわたり自己回帰的テキストto動画生成を一貫性を持って行うにはどうすればよいか?
  • RQ2自己回帰的動画生成中に、長期間にわたって視覚的一致性(例:オブジェクトの同一性、シーンレイアウト)を効果的に保持するメカニズムは何か?
  • RQ3自己回帰的動画生成に動画強化モデルを統合する際、時間的不整合を引き起こさずに実現するにはどうすればよいか?
  • RQ4アテンションベースの条件付け機構は、フレームベースやCLIPベースの条件付けに比べて、運動ダイナミクスと遷移の滑らかさをどの程度優れているか?
  • RQ5記憶拡張アーキテクチャは、既存のベースラインと比較して、長時間のテキストto動画生成における運動品質と時間的整合性を著しく向上させることができるか?

主な発見

  • StreamingT2V は、すべての競合オープンソース手法の中で最も低い MAWE スコア(10.87)を記録し、優れた運動の一貫性と動画停止の低減を示している。
  • SCuts スコアは 0.04 と最低を記録し、FreeNoise や SEINE に次いで僅かに劣るが、それとは異なり、高い運動ダイナミクスを維持しており、ほぼ静止した動画を生成しない。
  • CLIP スコアは 31.30 で、競合他社の中では2番目に高く、APM による長期間記憶のおかげで強力なテキスト整合性を示している。
  • APM は外見のずれを顕著に低減し、1200フレームにわたる動画においてもオブジェクトおよびシーンの特徴を維持していることが、定性的および定量的分析で裏付けられている。
  • ランダムブレンド戦略により、重複するチャンクにわたる動画強化器の適用が一貫して可能となり、強化された長時間動画における時間的アーチファクトを回避できる。
  • StreamingT2V は、運動ダイナミクスと時間的整合性において、全評価手法を上回っており、定性的な結果では滑らかでアーチファクトのない遷移と、停止のない動画が得られている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。