[论文解读] Dual-Stream Diffusion Net for Text-to-Video Generation
本文提出了一种新型文本到视频生成框架——双流扩散网络(Dual-Stream Diffusion Net, DSDN),该框架将视频内容与运动分离为两个独立的扩散流,并通过基于交叉注意力的跨流交互机制提升时序一致性。通过将运动建模为专用分支并引入运动解耦器/组合器模块,该方法有效减少了闪烁现象,提升了生成视频的视觉连贯性与多样性,在定性和定量评估中均优于先前方法。
With the emerging diffusion models, recently, text-to-video generation has aroused increasing attention. But an important bottleneck therein is that generative videos often tend to carry some flickers and artifacts. In this work, we propose a dual-stream diffusion net (DSDN) to improve the consistency of content variations in generating videos. In particular, the designed two diffusion streams, video content and motion branches, could not only run separately in their private spaces for producing personalized video variations as well as content, but also be well-aligned between the content and motion domains through leveraging our designed cross-transformer interaction module, which would benefit the smoothness of generated videos. Besides, we also introduce motion decomposer and combiner to faciliate the operation on video motion. Qualitative and quantitative experiments demonstrate that our method could produce amazing continuous videos with fewer flickers.
研究动机与目标
- 为解决文本到视频生成中的闪烁与不一致性问题,特别是在时序帧过渡过程中。
- 在保持内容多样性的同时,提升视频帧之间的运动一致性和视觉连贯性。
- 将运动建模为与内容生成分离的专用扩散流,以实现更好的控制与质量。
- 设计一种基于交叉注意力的交互机制,在去噪过程中对齐内容与运动表征。
- 引入运动解耦器与组合器模块,以更有效地操控视频生成中的运动表征。
提出的方法
- 该模型采用双流架构:内容流基于预训练的文本到图像扩散模型,运动流则采用3D U-Net以建模时序动态。
- 内容流与运动流独立训练,但通过交叉变换器交互模块实现对齐,进而在去噪过程中启用交叉注意力。
- 内容流通过一种增量单元增强,以学习超越基础模型的个性化内容变化。
- 运动流配备运动解耦器,用于将运动分离为解耦的组件,以及运动组合器,用于重建连贯的运动序列。
- 两流之间的交叉注意力使每一方能够关注对方的特征,从而提升时序一致性并减少闪烁。
- 该框架通过微调增量内容单元支持个性化视频生成,同时保持基础模型的泛化能力。
实验结果
研究问题
- RQ1将内容与运动解耦为独立的扩散流,是否能提升文本到视频生成中的时序一致性?
- RQ2内容流与运动流之间的交叉注意力在减少闪烁和增强视觉连贯性方面效果如何?
- RQ3与联合建模相比,专用运动分支在提升运动多样性与真实感方面能发挥多大作用?
- RQ4运动解耦器与组合器模块在改善运动表征与控制方面有何贡献?
- RQ5增量内容单元对基础模型之外的视觉质量与多样性有何影响?
主要发现
- 所提出的DSDN方法显著减少了闪烁现象,并提升了时序一致性,定性结果表明帧间过渡更加平滑。
- 该模型生成的视频具有高度的内容多样性,包括多样的动作(如猫朝不同方向行走)和视觉属性(如毛发颜色、姿态)。
- 消融实验表明,若移除运动模块,将导致帧间不一致与时序连贯性缺失,凸显其关键作用。
- 增量内容单元提升了视觉质量与稳定性,防止视角偏移并改善与文本提示的一致性。
- 运动模块可视化结果证实,对动态线索(如手臂摆动、头发飘动、身体运动)的建模准确。
- 该方法在多样化提示下表现稳健,仅出现极少数失败案例(如轻微颜色不一致),主要归因于背景干扰。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。