[论文解读] DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation
该论文提出了一种名为DirecT2V的零样本文本到视频生成框架,利用指令微调的大规模语言模型(LLMs)作为帧级导演,从抽象用户提示生成具有时间连贯性与叙事性的视频。通过将提示分解为随时间变化的帧级描述,并利用旋转值映射与双Softmax过滤机制将其与T2I扩散模型集成——无需额外训练——该方法在叙事一致性、真实感和对输入提示的忠实度方面达到了最先进性能。
In the paradigm of AI-generated content (AIGC), there has been increasing attention to transferring knowledge from pre-trained text-to-image (T2I) models to text-to-video (T2V) generation. Despite their effectiveness, these frameworks face challenges in maintaining consistent narratives and handling shifts in scene composition or object placement from a single abstract user prompt. Exploring the ability of large language models (LLMs) to generate time-dependent, frame-by-frame prompts, this paper introduces a new framework, dubbed DirecT2V. DirecT2V leverages instruction-tuned LLMs as directors, enabling the inclusion of time-varying content and facilitating consistent video generation. To maintain temporal consistency and prevent mapping the value to a different object, we equip a diffusion model with a novel value mapping method and dual-softmax filtering, which do not require any additional training. The experimental results validate the effectiveness of our framework in producing visually coherent and storyful videos from abstract user prompts, successfully addressing the challenges of zero-shot video generation.
研究动机与目标
- 为解决从抽象用户提示进行零样本文本到视频生成时保持叙事一致性和时间连贯性的挑战。
- 探索指令微调的LLMs在生成随时间变化的帧级描述方面的能力,以捕捉动态动作与演变的场景。
- 开发一种无需训练的方法,通过调制的自注意力机制提升基于扩散模型的视频生成中的时间一致性。
- 通过LLM引导的提示分解实现对视频属性(如帧率和时长)的控制。
提出的方法
- 利用指令微调的LLMs(如GPT-4)将单一抽象用户提示分解为逐帧描述,分离静态与动态元素。
- 提出旋转值映射(RVM),在每个扩散时间步动态选择参考帧以传播注意力值,实现在帧之间的动态内容传播。
- 采用双Softmax过滤(DSF)从自注意力层计算置信度掩码,过滤掉不可靠的值映射,减少错误的跨帧注意力。
- 将这些机制集成到预训练的文本到图像扩散模型(如Stable Diffusion)中,无需任何额外微调或训练。
- 使用缓存机制处理高帧数视频生成时的批量大小限制。
- 通过递归分割提示的提示工程方法控制视频属性,如帧率和总时长。

实验结果
研究问题
- RQ1指令微调的LLMs能否有效从单一抽象文本提示生成用于视频生成的帧级、随时间变化的描述?
- RQ2在不微调扩散模型的前提下,如何提升零样本文本到视频生成中的时间一致性?
- RQ3旋转值映射与双Softmax过滤在多大程度上能减少错误的注意力映射并提升视觉连贯性?
- RQ4LLM引导的提示分解能否实现对视频属性(如帧率和时长)的控制?
主要发现
- 用户研究表明,DirecT2V对用户提示的忠实度达到90.48%,显著优于最先进基线方法T2V-Z的9.52%。
- 人类评估显示,该方法在真实感方面达到93.45%,叙事质量达到92.86%,展现出优越的视觉与叙事连贯性。
- 消融实验表明,若无旋转值映射,模型无法准确描绘演变场景,如雷暴的发展或猎豹冲刺的过程。
- 双Softmax过滤有效防止了错误的注意力映射,例如将一帧的眼睛错误映射到另一帧,从而减少了视觉伪影。
- 通过递归提示LLM分割帧,该框架成功生成高帧率视频,实现了突破批量大小限制的生成能力。
- 所提方法在无需任何微调的情况下保持高性能,完全依赖提示工程与注意力机制的修改。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。