[論文レビュー] ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation
ConsistI2V は、最初のフレームの空間的・時間的注意と、その低周波数帯域からのノイズ初期化を活用することで、画像から動画への変換(I2V)生成における視覚的一致性を向上させる拡散ベース手法を提案する。この手法は、I2V-Bench において最先端の性能を達成し、従来手法と比較して動きのなめらかさ、オブジェクトの一貫性、レイアウトの忠実度が顕著に向上した。
Image-to-video (I2V) generation aims to use the initial frame (alongside a text prompt) to create a video sequence. A grand challenge in I2V generation is to maintain visual consistency throughout the video: existing methods often struggle to preserve the integrity of the subject, background, and style from the first frame, as well as ensure a fluid and logical progression within the video narrative. To mitigate these issues, we propose ConsistI2V, a diffusion-based method to enhance visual consistency for I2V generation. Specifically, we introduce (1) spatiotemporal attention over the first frame to maintain spatial and motion consistency, (2) noise initialization from the low-frequency band of the first frame to enhance layout consistency. These two approaches enable ConsistI2V to generate highly consistent videos. We also extend the proposed approaches to show their potential to improve consistency in auto-regressive long video generation and camera motion control. To verify the effectiveness of our method, we propose I2V-Bench, a comprehensive evaluation benchmark for I2V generation. Our automatic and human evaluation results demonstrate the superiority of ConsistI2V over existing methods.
研究の動機と目的
- 最初のフレームからの被写体、背景、スタイルの保持に失敗する、画像から動画への生成における視覚的一致性の問題を解決すること。
- 特に長時間または複雑な物語構成の動画において、動きのなめらかさと時間的整合性を向上させること。
- 微調整やアーキテクチャの大幅な変更を必要とせず、堅牢で汎用性の高い一貫性向上手法を開発すること。
- 標準的な指標を超えて I2V 生成モデルを評価できる包括的ベンチマーク、I2V-Bench の導入。
- 一貫性のある条件付けを可能にすることで、自己回帰的長時間動画生成やカメラの動き制御といった実用的応用を実現すること。
提案手法
- 空間的および時間的次元において最初のフレームに条件づけられる空間的・時間的注意メカニズムを導入し、空間的レイアウトと動きの一貫性を維持する。
- 空間層におけるフレーム間注意を適用することで、最初のフレームのコンテンツと構造に対する細粒度の整合性を強化する。
- 時間的注意に最初のフレームの局所的特徴を組み込むことで、動きの軌道を安定化させ、ジターリダムを低減する。
- 訓練時と推論時のノイズ分布の不一致を低減するため、最初のフレームの低周波数帯域を用いたノイズ初期化戦略である FrameInit を提案する。
- 同じ条件付けおよび初期化メカニズムを再利用することで、自己回帰的長時間動画生成およびカメラの動き制御への応用を可能にする。
- 多スケール評価フレームワークを用い、I2V-Bench を活用して、多様なカテゴリにおける自動指標と人間評価を統合する。

実験結果
リサーチクエスチョン
- RQ1最初のフレームに対する空間的・時間的条件づけは、画像から動画への生成における視覚的一致性を顕著に向上させることができるか?
- RQ2最初のフレームの低周波数成分からのノイズ初期化は、動画サンプリング中の視覚的不一致を低減するか?
- RQ3本手法は、動きのなめらかさ、オブジェクトの一貫性、レイアウトの忠実度という観点で、既存の I2V モデルと比較してどのように優れているか?
- RQ4FrameInit は、自己回帰的長時間動画生成などの他の動画生成パラダイムにも一般化可能か?
- RQ5I2V-Bench は、標準的な指標を超えて、I2V モデルの信頼性と包括的な評価をどの程度可能にするか?
主な発見
- ConsistI2V は I2V-Bench で最先端の性能を達成し、テキスト-動画全体の一貫性で平均 97.77 のスコアを記録。SEINE(97.07)や DynamiCrafter(95.89)を上回った。
- SEINE と比較して、平均 1.87 ポイントの動きのなめらかさ向上を達成し、動きのなめらかさ評価の All カテゴリーで 96.08 を記録した。
- オブジェクトの一貫性は SEINE と比較して 3.21 ポイント向上し、ConsistI2V は All カテゴリーで 32.06、SEINE は 35.43 のスコアを記録した。
- レイアウトおよびシーンの一貫性が顕著に向上し、ConsistI2V はシーン一貫性(All)で 24.81 を達成。SEINE の 27.68 を上回った。
- FrameInit は、訓練時と推論時のノイズ差を低減させ、特に長時間動画やカメラの動きシナリオにおいて、より安定的かつ一貫性のある動画生成を実現した。
- 本手法は、自己回帰的長時間動画生成やカメラの動き制御へも効果的に一般化され、標準的な I2V タスクを超えた拡張性を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。