[論文レビュー] Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising
本稿では、追加学習を伴わずに市販の短時間動画拡散モデルを用いて、複数のテキスト条件付き長時間動画生成および編集を可能にする新規フレームワーク、Gen-L-Videoを提案する。重複する短時間動画クリップを用いた時間的共同ノイズ除去と双方向クロスフレームアテンションを活用することで、数百フレームにわたる高精度なフレーム一貫性と意味的整合性を達成し、定量的および定性的な評価において、個別ノイズ除去および既存手法を著しく上回る結果を得た。
Leveraging large-scale image-text datasets and advancements in diffusion models, text-driven generative models have made remarkable strides in the field of image generation and editing. This study explores the potential of extending the text-driven ability to the generation and editing of multi-text conditioned long videos. Current methodologies for video generation and editing, while innovative, are often confined to extremely short videos (typically less than 24 frames) and are limited to a single text condition. These constraints significantly limit their applications given that real-world videos usually consist of multiple segments, each bearing different semantic information. To address this challenge, we introduce a novel paradigm dubbed as Gen-L-Video, capable of extending off-the-shelf short video diffusion models for generating and editing videos comprising hundreds of frames with diverse semantic segments without introducing additional training, all while preserving content consistency. We have implemented three mainstream text-driven video generation and editing methodologies and extended them to accommodate longer videos imbued with a variety of semantic segments with our proposed paradigm. Our experimental outcomes reveal that our approach significantly broadens the generative and editing capabilities of video diffusion models, offering new possibilities for future research and applications. The code is available at https://github.com/G-U-N/Gen-L-Video.
研究の動機と目的
- 既存のテキストから動画生成モデルが短時間動画(通常24フレーム未塔)に限定され、単一のテキスト条件に制限されているという制限を解消すること。
- 多様なテキストプロンプトを用いた複数の意味的セグメントにわたる一貫性があり、整合性のある長時間動画生成を可能にすること。
- 追加のトレーニングを必要とせず、既存の短時間動画拡散モデルを拡張して長時間動画生成および編集を可能にする汎用フレームワークを開発すること。
- オブジェクトの置き換え、スタイル変換、ポーズ制御などの編集タスクをサポートしつつ、長時間動画における高いフレーム一貫性とテキストとの整合性を維持すること。
- 自己回帰的長時間動画生成におけるコンテンツ劣化と推論非効率性を、重複するクリップノイズ除去を用いることで克服すること。
提案手法
- 長時間動画を重複する短時間動画クリップのシーケンスとして扱い、時間的境界を越えた共同ノイズ除去を可能にする。
- 各短時間動画クリップを、異なるテキスト条件のもとで既存の市販のテキストから動画拡散モデルを用いて個別にノイズ除去する。
- 隣接するクリップを重ねることで(例:ストライド=4、クリップ長=16フレーム)、時間的境界での一貫性を向上させる時間的共同ノイズ除去戦略を適用する。
- ノイズ除去中に時間的に前向きおよび後向きに情報が流れることを可能にする双方向クロスフレームアテンションを導入し、時間的整合性を向上させる。
- ランダムノイズを使用するワンショットチューニングパイプラインにおいて、動画クリップ識別子を用いて運動の連続性を保持し、コンテンツの一貫性を損なうのを防ぐ。
- ノイズ除去済みのクリップを統合し、元のノイズの少ない長時間動画に逆変換することで、トレーニングなしに抽象的な長時間動画生成器を構築する。
実験結果
リサーチクエスチョン
- RQ1市販の短時間動画拡散モデルを、追加のトレーニングなしに数百フレームにわたる長時間動画生成に効果的に拡張できるか?
- RQ2多様な動画セグメントにわたる意味的整合性を保ちながら、長時間動画生成におけるマルチテキスト条件付き処理をどのように実現できるか?
- RQ3クリップが個別にノイズ除去される状況下で、長時間動画における高いフレーム一貫性を実現する時間的ノイズ除去戦略は何か?
- RQ4スパース因果アテンションと比較して、双方向クロスフレームアテンションは時間的整合性をどの程度向上させるか?
- RQ5提案されたフレームワークは、オブジェクトの置き換え、スタイル変換、マスクガイド付きインpaintingなどの多様な編集タスクをサポートできるか?
主な発見
- Gen-L-Videoはフレーム一貫性スコア93.18(個別ノイズ除去の91.65対比)を達成し、時間的整合性の顕著な向上を示した。
- テキスト整合性スコアは21.18(個別ノイズ除去の21.16対比)で、分散は0.48(対比0.57)であり、より安定的かつ正確なテキスト-動画整合性を示した。
- 人間の好み評価では、フレーム一貫性およびテキスト整合性の観点で、Gen-L-Videoが個別ノイズ除去を85.38%の割合で上回った。
- フレームワークは、オブジェクトの置き換え、背景変更、スタイル変換、ポーズ制御など、多様な編集タスクを一貫した結果でサポートした。
- アブレーションスタディにより、双方向クロスフレームアテンションはスパース因果アテンションと比較して、初期フレームにおける不整合を低減することが確認された。
- 本手法により、再トレーニングを必要とせず、事前学習済みモデルのみで数百フレームにわたる長時間動画生成が可能となり、自己回帰的アプローチのコンテンツ劣化と非効率性を回避した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。