Skip to main content
QUICK REVIEW

[論文レビュー] FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling

Haonan Qiu, Menghan Xia|arXiv (Cornell University)|Oct 23, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

FreeNoiseは、長時間の時間的相関を確立するために初期ノイズを再スケジューリングし、ウィンドウベースのアテンション統合を可能にすることで、微調整を必要とせず計算効率の高い方法で、事前学習済みの拡散モデルから高精細な長時間動画を生成する手法を提案する。さらに、微fine-tuningなしで複数のテキスト条件をサポートするためのモーションインジェクションを導入し、わずか17%の追加推論時間で最先端の動画品質を達成した。これは、先行手法の255%のコストと比べて顕著に低い。

ABSTRACT

With the availability of large-scale video datasets and the advances of diffusion models, text-driven video generation has achieved substantial progress. However, existing video generation models are typically trained on a limited number of frames, resulting in the inability to generate high-fidelity long videos during inference. Furthermore, these models only support single-text conditions, whereas real-life scenarios often require multi-text conditions as the video content changes over time. To tackle these challenges, this study explores the potential of extending the text-driven capability to generate longer videos conditioned on multiple texts. 1) We first analyze the impact of initial noise in video diffusion models. Then building upon the observation of noise, we propose FreeNoise, a tuning-free and time-efficient paradigm to enhance the generative capabilities of pretrained video diffusion models while preserving content consistency. Specifically, instead of initializing noises for all frames, we reschedule a sequence of noises for long-range correlation and perform temporal attention over them by window-based function. 2) Additionally, we design a novel motion injection method to support the generation of videos conditioned on multiple text prompts. Extensive experiments validate the superiority of our paradigm in extending the generative capabilities of video diffusion models. It is noteworthy that compared with the previous best-performing method which brought about 255% extra time cost, our method incurs only negligible time cost of approximately 17%. Generated video samples are available at our website: http://haonanqiu.com/projects/FreeNoise.html.

研究の動機と目的

  • 既存の動画拡散モデルが短い動画クリップで学習されているため、推論時に高精細な長時間動画を生成できないという制限を解決すること。
  • 微fine-tuningなしで複数のテキスト条件付き動画生成を可能にし、時間経過に伴う動的なコンテンツ変化をサポートすること。
  • コンテンツの一貫性を保ちつつ、計算コストを最小限に抑える長時間動画生成を向上させる手法を開発すること。
  • 初期ノイズの役割が時間的モデリングに与える影響、および動画生成品質に与える影響を調査すること。

提案手法

  • 長時間の動画生成に適した長距離時間的相関を確立するために、固定されたランダムノイズフレームのシーケンスを再スケジューリングする、微調整不要なパラダイム「FreeNoise」を提案する。
  • 内部のランダム性と長距離の整合性を持つノイズシーケンスを生成するための「ローカルノイズシャッフル」を導入し、延長された動画長にわたり一貫性のあるコンテンツを実現する。
  • 重複する時間ウィンドウを適用することで、事前学習済みの時間的アテンションモジュールがより長いシーケンスを処理できるようにする「ウィンドウベースのアテンション統合」を採用し、他のモデル部品への追加計算コストは発生しない。
  • 特定のノイズ除去ステップに新しいモーションキューをインジェクションすることで、複数プロンプト対応の動画生成を可能にする「モーションインジェクション」を設計し、オブジェクト形状回復段階と整合させる。
  • 2段階のノイズ除去戦略を採用し、最初のプロンプトでレイアウトとオブジェクト形状を制御し、後続のステップで新しいプロンプトをインジェクションしてモーション変化を導入する。
  • 微fine-tuningなしに複数の事前学習モデル(VideoCrafter、AnimateDiff、LaVie)に適用可能であり、広範な適用可能性と効率性を確保する。

実験結果

リサーチクエスチョン

  • RQ1初期ノイズ分布が拡散モデルにおける長時間動画生成の品質と一貫性に与える影響は何か?
  • RQ2ノイズの再スケジューリングにより、微fine-tuningや顕著な計算コスト増加なしに、より長い動画生成が可能になるか?
  • RQ3複数のテキスト条件を効果的に動画拡散モデルに統合する方法は何か?これにより、動的なシーン遷移が可能になるか?
  • RQ4視覚的一致性を保ちつつ滑らかな遷移を実現するための、新しいモーションキューの最適なタイミングとレイヤーは何か?
  • RQ5ウィンドウベースのアテンション機構により、事前学習済みの時間的モジュールの受容 field を拡張できるか?追加の推論オーバーヘッドは発生しないか?

主な発見

  • FreeNoiseは、17%の追加推論時間で最先端の動画品質を達成した一方、前回の最良手法は255%のコストを要した。
  • アブレーションスタディにより、ノイズ再スケジューリングにおけるストライド4が、推論コストを倍増させることなく十分なコンテンツ一貫性を提供することが確認された。
  • モーションインジェクションにより、走りから立ち上がりへの行動遷移など、1本の動画内で滑らかな遷移が実現され、最小限の視覚的アーチファクトで実現された。
  • 新しいモーションがインジェクションされても、馬やボウルなどの主な被写体の外観が長時間の動画シーケンスにわたり一貫して保持された。
  • ウィンドウベースのアテンション統合により、元の事前学習済み時間的アテンションモジュールのみで、任意の長さの動画長を処理できるようになった。
  • 複数のベンチマークでの定性的および定量的評価により、長距離フレーム間のコンテンツ一貫性が維持されていることが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。