Skip to main content
QUICK REVIEW

[論文レビュー] Seer: Language Instructed Video Prediction with Latent Diffusion Models

Xianfan Gu, Chuan Wen|arXiv (Cornell University)|Mar 27, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

Seerは、時間軸に沿って微調整されたテキストから画像への拡散モデルを拡張することで、高精細で指示に整合した動画フレームを生成する動画予測モデルを提案する。空間的・時間的注意機構とフレーム逐次的テキスト分解器を導入することで、わずか480 GPU時間で、SSv2でFVDが31%低く、人間の好みが83.7%に達する最先端の性能を達成。これは従来の手法と比べて顕著に少ない計算リソースを要する。

ABSTRACT

Imagining the future trajectory is the key for robots to make sound planning and successfully reach their goals. Therefore, text-conditioned video prediction (TVP) is an essential task to facilitate general robot policy learning. To tackle this task and empower robots with the ability to foresee the future, we propose a sample and computation-efficient model, named extbf{Seer}, by inflating the pretrained text-to-image (T2I) stable diffusion models along the temporal axis. We enhance the U-Net and language conditioning model by incorporating computation-efficient spatial-temporal attention. Furthermore, we introduce a novel Frame Sequential Text Decomposer module that dissects a sentence's global instruction into temporally aligned sub-instructions, ensuring precise integration into each frame of generation. Our framework allows us to effectively leverage the extensive prior knowledge embedded in pretrained T2I models across the frames. With the adaptable-designed architecture, Seer makes it possible to generate high-fidelity, coherent, and instruction-aligned video frames by fine-tuning a few layers on a small amount of data. The experimental results on Something Something V2 (SSv2), Bridgedata and EpicKitchens-100 datasets demonstrate our superior video prediction performance with around 480-GPU hours versus CogVideo with over 12,480-GPU hours: achieving the 31% FVD improvement compared to the current SOTA model on SSv2 and 83.7% average preference in the human evaluation.

研究の動機と目的

  • 初期フレームと自然言語の指示に条件づけられた時間的に整合性があり、高精細な動画フレームを生成する課題に対処すること。
  • 事前学習済みのテキストから画像への拡散モデルを活用することで、テキストから動画への生成に一般的に見られる高い計算およびデータ要件を低減すること。
  • 言語指示とフレームごとの動きの間の微細な整合性を向上させるために、グローバルな指示を時間的に構造化された部分指示に分解すること。
  • 事前学習済みモデルを微調整することで、学習から再構築するのではなく、小規模なデータセットでの効率的な微調整を可能にすること。
  • 高い視覚的精細度と指示の一貫性を維持しながら、動画予測で強力なパフォーマンスを達成すること。

提案手法

  • 空間的および時間的依存関係を同時にモデル化できるように、事前学習済みの2次元テキストから画像への拡散モデルを3次元U-Netアーキテクチャに拡張すること。
  • 潜在空間における長距離時間的ダイナミクスを効率的にモデル化するため、スケーリングされた自己回帰的ウィンドウ時間的注意を導入すること。
  • グローバルなテキスト指示を時間的に整合された部分指示に分割するフレーム逐次的テキスト分解器を設計すること。
  • 小規模なテキスト・動画データセット上でモデルの数層のみを微調整することで、事前学習済みの事前知識を保持しながら動画生成に適応させること。
  • ノイズ予測ヘッドを備えた潜在的拡散を用い、潜在空間上で段階的にフレームを生成することで、高精細な出力を保証すること。
  • フレーム補間と繰り返し戦略を適用し、追加の推論コストなしに元の12フレームのコンテキストを超えて生成を拡張すること。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みのテキストから画像への拡散モデルを、最小限の微調整でテキスト条件付き動画予測に効果的に適応できるか。
  • RQ2グローバルな言語指示をどのように時間的に整合された部分指示に分解することで、フレームレベルの動きの整合性を向上させられるか。
  • RQ33次元U-Netアーキテクチャにおける空間的・時間的注意機構が、生成された動画フレームの時間的整合性と視覚的品質をどの程度保持できるか。
  • RQ4既存の手法と比較して、計算コストを著しく削減しながらも、動画予測で最先端のパフォーマンスを達成できるか。
  • RQ5モデルは、シーンの複雑さや運動ダイナミクスが異なる多様なデータセットに対して、どの程度一般化できるか。

主な発見

  • Something-Something V2データセットにおいて、Seerは前回の最先端モデルと比較してFVD(Fréchet Video Distance)を31%改善し、FVDは20.5から14.2に低下した。
  • 人間による評価では、他の最先端モデルと比較して83.7%の割合でSeerが好まれ、明確な知覚的品質と指示の整合性を示した。
  • 訓練にはたった480 GPU時間しか必要とせず、CogVideoの12,480 GPU時間と比較して96%の計算リソース削減を達成し、極めて高いデータおよび計算効率を示した。
  • フレーム逐次的テキスト分解器により、『ビールの缶を傾ける』や『カードを落とす』といったタスクレベルの指示に整合した正確な動き生成が可能になった。
  • SeerはSSv2、BridgeData、Epic-Kitchens-100といった多様なデータセットにわたって良好に一般化し、さまざまな運動タイプや環境に対して頑健であることが示された。
  • 強力なパフォーマンスを発揮する一方で、Seerは外見の一貫性(例:物体の色や背景)を常に保持できず、参照フレームに存在しない新しいカメラアングルや視点を生成することがある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。