[论文解读] CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers
CogVideo 是一个9.4B参数的开放域文本到视频生成 transformer。它通过多帧率分层训练策略和双通道注意力对 CogView2 进行微调,以在公开模型中实现最先进的结果。
Large-scale pretrained transformers have created milestones in text (GPT-3) and text-to-image (DALL-E and CogView) generation. Its application to video generation is still facing many challenges: The potential huge computation cost makes the training from scratch unaffordable; The scarcity and weak relevance of text-video datasets hinder the model understanding complex movement semantics. In this work, we present 9B-parameter transformer CogVideo, trained by inheriting a pretrained text-to-image model, CogView2. We also propose multi-frame-rate hierarchical training strategy to better align text and video clips. As (probably) the first open-source large-scale pretrained text-to-video model, CogVideo outperforms all publicly available models at a large margin in machine and human evaluations.
研究动机与目标
- 激发使用大规模预训练变换器进行文本到视频生成,超越文本和文本到图像领域。
- 利用预训练的文本到图像知识,促进视频生成,而无需从头完全预训练。
- 提出一种多帧率分层训练策略,以将文本与时间上的视频语义对齐。
- 开发一种双通道注意力机制,以高效地将图像模型知识融入视频生成。
提出的方法
- 使用一个9.4B参数的变换器对预训练的 CogView2 文本到图像模型进行微调,以实现文本到视频生成。
- 引入多帧率分层训练,通过加入帧率标记和分阶段生成(先序列关键帧再帧内插)来将文本提示与帧对齐。
- 采用双通道注意力模块,冻结 CogView2 参数,仅训练新增的时空注意力通道(attention-plus),以融合图像和视频建模。
- 将移位窗口(Swin)注意力扩展到自回归生成,以实现部分并行并降低内存成本。
- 使用 CogLM 风格的双向/单向掩蔽,允许在插值时获得双向上下文,同时保持自回归帧生成。
实验结果
研究问题
- RQ1开放域文本到视频生成如何利用现有的文本到图像预训练模型达到强性能?
- RQ2多帧率分层训练策略是否提升文本-视频对齐和运动语义?
- RQ3双通道注意力机制是否能在无需完全重新训练的情况下有效将图像-语言知识转移到视频生成?
- RQ4使用移位窗口注意力对自回归视频生成效率的影响是什么?
主要发现
- CogVideo 在公开可用的文本到视频模型中,在 UCF-101 和 Kinetics-600 上达到定性和定量的最先进性能。
- 分层多帧率生成在文本-视频对齐和运动语义方面优于单阶段生成。
- 将 CogView2 与双通道注意力(attention-plus)一起微调,在参数冻结 CogView2 的同时,效果优于从头训练或使用随机初始化。
- 移位窗口注意力在自回归视频生成中实现部分帧级并行,加速推理。
- 人类评估显示 CogVideo 在帧纹理、运动真实感和语义相关性方面超越基线。
- 消融研究显示分层方法和 CogView2 初始化模型优于随机初始化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。