[論文レビュー] Mora: Enabling Generalist Video Generation via A Multi-Agent Framework
Moraは、プロンプト強化、画像生成、動画合成、動画編集の各専門的エージェントにタスクを分解することで、一般化された動画生成を可能にするマルチエージェントフレームワークを提案する。テキストから動画への生成、画像から動画への生成、動画の延長、デジタルワールドシミュレーションなどの多様なタスクにおいて、Soraに類似した性能を達成しているが、品質と長さの面でSoraと比較して差異が生じている。
Text-to-video generation has made significant strides, but replicating the capabilities of advanced systems like OpenAI Sora remains challenging due to their closed-source nature. Existing open-source methods struggle to achieve comparable performance, often hindered by ineffective agent collaboration and inadequate training data quality. In this paper, we introduce Mora, a novel multi-agent framework that leverages existing open-source modules to replicate Sora functionalities. We address these fundamental limitations by proposing three key techniques: (1) multi-agent fine-tuning with a self-modulation factor to enhance inter-agent coordination, (2) a data-free training strategy that uses large models to synthesize training data, and (3) a human-in-the-loop mechanism combined with multimodal large language models for data filtering to ensure high-quality training datasets. Our comprehensive experiments on six video generation tasks demonstrate that Mora achieves performance comparable to Sora on VBench, outperforming existing open-source methods across various tasks. Specifically, in the text-to-video generation task, Mora achieved a Video Quality score of 0.800, surpassing Sora 0.797 and outperforming all other baseline models across six key metrics. Additionally, in the image-to-video generation task, Mora achieved a perfect Dynamic Degree score of 1.00, demonstrating exceptional capability in enhancing motion realism and achieving higher Imaging Quality than Sora. These results highlight the potential of collaborative multi-agent systems and human-in-the-loop mechanisms in advancing text-to-video generation. Our code is available at \url{https://github.com/lichao-sun/Mora}.
研究の動機と目的
- OpenAIのSoraのように閉鎖的で、大多数の研究者にアクセスできない一般化されたオープンソース動画生成モデルの不足に対処すること。
- 10秒を超える長時間、高解像度、時間的に一貫性のある動画生成に苦労する既存の動画モデルの限界を克服すること。
- テキストから動画への生成、画像から動画への生成、動画の延長、編集、接続、デジタルワールドシミュレーションを含む、幅広い動画生成タスクを、協働的エージェントベースのアーキテクチャで実現すること。
- 視覚的品質と指示遵守を保持しながら、モジュラーで柔軟なエージェントパイプラインを用いてSoraの一般化された能力を再現すること。
- 研究とイノベーションを進めるために、透明性があり、オープンで拡張可能なフレームワークを提供すること。
提案手法
- 動画生成を5つのコアサブタスクに分解:プロンプト強化、テキストから画像への生成、条件付きテキストを用いた画像の精錬、画像から動画への生成、動画の接続。
- 各サブタスクに特化したエージェントを配置し、ループおよび順列入れ替えによるタスク実行を経て、動的かつ最適化されたパイプラインを実現。
- 高精細な画像および動画生成のための基盤として、事前学習済みのビジョン・ランゲージモデル(例:テキストから画像への拡散モデル)を活用。
- 推論中にエージェント間の適応的ルーティングとフィードバックを可能にするメタプログラミング手法を用いて、マルチエージェントの協調制御を実現。
- 反復的精錬と条件付けを適用し、生成された動画全体にわたる時間的一致性と視覚的一致性を維持。
- 新規エージェントやモデルのプラグアンドプレイ統合が可能なモジュラーなパイプラインアーキテクチャを活用。
実験結果
リサーチクエスチョン
- RQ1オープンソースコンponentsを用いて、マルチエージェントフレームワークがSoraの一般化された動画生成能力を再現できるか?
- RQ2協働的エージェントシステムは、テキストから動画への生成、画像から動画への生成、動画の延長、編集などの多様な動画生成タスクにおいて、どの程度の性能を示すか?
- RQ3Soraのような閉鎖型最先端モデルと比較して、オープンソースのマルチエージェントシステムの動画品質、長さ、指示遵守性の面での性能ギャップはどの程度か?
- RQ4中間の視覚的出力(例:画像)が、エンドツーエンドの動画生成における忠実性と一貫性をどの程度向上できるか?
- RQ5人間の好みはこのフレームワークの出力とどの程度一致するか、また物理的リアリズムと動き制御の面でどのような限界があるか?
主な発見
- Moraは、テキストプロンプトから1024×576解像度、最大12秒(75フレーム)の時間的に一貫性のある動画を生成でき、特定のタスクではSoraと同等の視覚的品質を達成した。
- フレームワークは6つの一般化された動画生成タスクをサポート:テキストから動画への生成、テキスト条件付き画像から動画への生成、動画の延長、動画から動画への編集、動画の接続、デジタルワールドシミュレーション。
- Moraはプロンプトの忠実遵守と視覚的多様性に優れており、入力条件からのスタイルとコンテンツの保持を実現したが、速度や方向といった正確な運動ダイナミクスの制御には苦労している。
- Moraの能力にもかかわらず、12秒を超える動画の生成や、その長期間にわたる高精細維持において、Soraと顕著な性能ギャップを示している。
- 人間の好み評価では、論理的でない遷移(例:男性から女性への図形の崩壊)が見られ、物理的リアリズムや人間の視覚的期待との整合性を高める必要があることが示された。
- マルチエージェントアプローチにより、柔軟でモジュラーかつ拡張可能な動画生成パイプラインが実現され、Soraのような閉鎖型モデルに対する実用的なオープンソース代替案を提供した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。