[论文解读] Movie Gen: A Cast of Media Foundation Models
Movie Gen 提供一组用于高质量1080p高清视频的基础模型,具同步音频、个性化视频和精确视频编辑能力,使用 Flow Matching 在大规模图像、视频和音频数据上训练,在文本到视频、视频个性化、视频编辑和文本到音频任务上达到最新水平。
We present Movie Gen, a cast of foundation models that generates high-quality, 1080p HD videos with different aspect ratios and synchronized audio. We also show additional capabilities such as precise instruction-based video editing and generation of personalized videos based on a user's image. Our models set a new state-of-the-art on multiple tasks: text-to-video synthesis, video personalization, video editing, video-to-audio generation, and text-to-audio generation. Our largest video generation model is a 30B parameter transformer trained with a maximum context length of 73K video tokens, corresponding to a generated video of 16 seconds at 16 frames-per-second. We show multiple technical innovations and simplifications on the architecture, latent spaces, training objectives and recipes, data curation, evaluation protocols, parallelization techniques, and inference optimizations that allow us to reap the benefits of scaling pre-training data, model size, and training compute for training large scale media generation models. We hope this paper helps the research community to accelerate progress and innovation in media generation models. All videos from this paper are available at https://go.fb.me/MovieGenResearchVideos.
研究动机与目标
- 促使开发一套统一、可扩展的媒体生成基础模型(图像、视频、音频)。
- 在文本到视频、视频个性化、编辑和音频生成方面展示最先进能力。
- 描述实现长上下文、高分辨率视频生成的体系结构、训练方案、数据整理与推理优化。
- 引入后训练个性化和精确编辑的过程,以扩展基线生成能力。
- 提供基准和公开资源,促进媒体生成模型的研究。
提出的方法
- 在大规模图像和视频数据上训练一个联合的图像与视频基础模型(Movie Gen Video),使用时空压缩潜在空间(TAE)。
- 采用 Flow Matching 作为训练目标,在潜在空间建模视频与图像生成的速度。
- 整合一个30B参数的 Transformer 主干,具备全双向注意力和来自多个文本编码器的跨注意力条件。
- 增加一个独立的13B参数 Movie Gen Audio 模型,用于视频到音频和文本到音频生成,输出同步。
- 实现后训练流程用于个性化(基于图像的条件化)和精确编辑(文本引导),无需大规模有监督编辑数据集。
- 通过视频到视频放大器进行空间放大(HD 1080p),并采用多扩散技术以实现时间一致性。
实验结果
研究问题
- RQ1是否有一个单一的基础模型框架能够联合生成高质量的图像和视频并同步音频?
- RQ2在没有大规模有监督编辑数据集的情况下,如何实现视频的个性化和精确编辑?
- RQ3在长上下文视频生成中,Flow Matching 相较于基于扩散的训练有哪些优势?
- RQ4多模态条件(文本提示、参考图像)如何影响生成质量和一致性?
- RQ5实现30B参数视频模型所需的可扩展性和效率策略(数据、计算、并行性)有哪些?
主要发现
- Movie Gen Video 30B 模型能够以16 FPS生成高质量的16秒HD视频,并实现音频同步。
- Movie Gen Audio 13B 模型在视频音频生成方面取得最先进的结果,包括音效和音乐。
- 后训练个性化使生成包含特定人物的视频,同时保持身份特征。
- 后训练精确编辑使对真实或生成视频进行文本指令引导的定向编辑成为可能。
- 该方法在文本到视频生成、视频个性化与编辑任务以及音频生成基准测试中达到最先进水平。
- Movie Gen Video 和 Movie Gen Audio 的基准公开发布,以便未来评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。