Skip to main content
QUICK REVIEW

[論文レビュー] Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation

Yingqing He, Menghan Xia|arXiv (Cornell University)|Jul 13, 2023
Video Analysis and Summarization被引用数 5
ひとこと要約

本論文では、動き構造が整合した動画クリップを検索し、それをもとにテキスト-to-動画生成を誘導することで、一貫性がありキャラクターが同一の物語中心の動画を合成する、リtrieval拡張型の動画生成フレームワーク「Animate-A-Story」を提案する。また、ベースラインを上回るキャラクターの忠実度と一貫性を向上させる、新しい概念パーソナライゼーション手法「TimeInv」を導入し、動画および画像パーソナライゼーションタスクで最先端の結果を達成している。

ABSTRACT

Generating videos for visual storytelling can be a tedious and complex process that typically requires either live-action filming or graphics animation rendering. To bypass these challenges, our key idea is to utilize the abundance of existing video clips and synthesize a coherent storytelling video by customizing their appearances. We achieve this by developing a framework comprised of two functional modules: (i) Motion Structure Retrieval, which provides video candidates with desired scene or motion context described by query texts, and (ii) Structure-Guided Text-to-Video Synthesis, which generates plot-aligned videos under the guidance of motion structure and text prompts. For the first module, we leverage an off-the-shelf video retrieval system and extract video depths as motion structure. For the second module, we propose a controllable video generation model that offers flexible controls over structure and characters. The videos are synthesized by following the structural guidance and appearance instruction. To ensure visual consistency across clips, we propose an effective concept personalization approach, which allows the specification of the desired character identities through text prompts. Extensive experiments demonstrate that our approach exhibits significant advantages over various existing baselines.

研究の動機と目的

  • 制御されたレイアウト、動き、一貫性のあるキャラクター外見を備えた高品質で整合性のある物語中心の動画を生成する課題に対処すること。
  • 既存のテキスト-to-動画モデルがシーン構成や動き構造の制御に限界を示しているのを克服すること。
  • 新しいパーソナライゼーション手法を通じて、リtrieval拡張型動画生成におけるキャラクターの一貫性の欠如問題を解決すること。
  • キャラクターのアイデンティティと外見をユーザーが制御しつつ、シーン間で構造的一致性を保つこと。

提案手法

  • テキストクエリに基づいて、シーンおよび動きの文脈を検索するための動き構造としての動画深度を抽出するために、市販の動画検索システムを用いる。
  • 取得した動き構造とテキストプロンプトに従って動画を生成する、構造誘導型テキスト-to-動画合成モデルを採用する。
  • 主モデルパラメータの微調整なしに、学習可能な埋め込みを最適化する、タイムステップ可変型のテキストインバージョン手法「TimeInv」を導入する。
  • テキストプロンプトと参照画像に条件付けた、TimeInvによる概念パーソナライゼーションを適用し、クリップ間で一貫したキャラクターのアイデンティティを維持する。
  • 二段階の訓練戦略を採用する:第一段階では、正則化のためWebVidから1キャラクターあたり200本の実動画を取得する。第二段階では、推論時にデータ拡張と分類器フリー誘導を適用する。
  • TimeInvをCustom Diffusionと組み合わせ、アテンションモジュールのキーとバリューを更新することで、視覚的精細度を向上させつつアーチファクトを低減する。

実験結果

リサーチクエスチョン

  • RQ1標準的なテキスト-to-動画モデルと比較して、リtrieval拡張型動画生成は、生成された物語中心の動画の構造的一致性と現実性を向上させることができるか?
  • RQ2TimeInvのようなパーソナライズドコンセプト表現手法は、多様なシーンや動画クリップ間でキャラクターのアイデンティティをどの程度効果的に維持できるか?
  • RQ3提案されたフレームワークは、動き構造の制御とキャラクター外見のパーソナライゼーションの間の矛盾をどの程度解消できるか?
  • RQ4リtrievalとパーソナライゼーションの統合は、定量的および定性的な指標において、既存のベースラインを上回る性能を発揮するか?

主な発見

  • 提案されたフレームワークは、動画生成品質において最先端の性能を達成しており、テディベアの文脈的類似度スコアは0.295、アイデンティティ忠実度は0.853を記録し、DreamBooth、Textual Inversion、Custom Diffusionを上回っている。
  • TimeInvはネコのアイデンティティ忠実度スコア0.902を達成し、Textual Inversion(0.743)を著しく上回っており、文脈的整合性と視覚的一致性の両面で他の手法と同等またはそれを上回っている。
  • 定性的な結果から、TimeInvはDreamBoothやTextual Inversionと比較してアーチファクトと過学習を低減している一方で、多様な背景を維持し、より良いキャラクターのディテールを保っていることが示された。
  • TimeInvは画像パーソナライゼーションに対しても良好に一般化され、Custom Diffusionと組み合わせることで背景の多様性と概念の構成性が向上している。
  • 本フレームワークは、構造と外見の分離を効果的に行っているため、背景や動きが変化しても、異なる物語シーン間で一貫したキャラクター再現を実現している。
  • アブレーションスタディの結果、リtrievalに基づく構造誘導とTimeInvパーソナライゼーションの組み合わせが、動画の一貫性とキャラクター忠実度の両方を顕著に向上させていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。