Skip to main content
QUICK REVIEW

[论文解读] DreamVideo: Composing Your Dream Videos with Customized Subject and Motion

Yujie Wei, Shiwei Zhang|arXiv (Cornell University)|Dec 7, 2023
Generative Adversarial Networks and Image Synthesis被引用 6
一句话总结

DreamVideo 提出了一种基于两阶段扩散模型的个性化视频生成方法,通过轻量级的身份和运动适配器,将主体身份与运动学习解耦。该方法仅需少量图像和视频即可实现对主体外观和运动模式的定制,在保真度、身份保持和运动多样性方面均优于先前方法,达到当前最先进水平。

ABSTRACT

Customized generation using diffusion models has made impressive progress in image generation, but remains unsatisfactory in the challenging video generation task, as it requires the controllability of both subjects and motions. To that end, we present DreamVideo, a novel approach to generating personalized videos from a few static images of the desired subject and a few videos of target motion. DreamVideo decouples this task into two stages, subject learning and motion learning, by leveraging a pre-trained video diffusion model. The subject learning aims to accurately capture the fine appearance of the subject from provided images, which is achieved by combining textual inversion and fine-tuning of our carefully designed identity adapter. In motion learning, we architect a motion adapter and fine-tune it on the given videos to effectively model the target motion pattern. Combining these two lightweight and efficient adapters allows for flexible customization of any subject with any motion. Extensive experimental results demonstrate the superior performance of our DreamVideo over the state-of-the-art methods for customized video generation. Our project page is at https://dreamvideo-t2v.github.io.

研究动机与目标

  • 为解决扩散模型中同时定制主体身份与运动的挑战,该挑战在现有研究中仍处于探索不足状态。
  • 克服现有方法仅优化主体或运动的局限性,从而提升泛化能力与性能表现。
  • 通过将主体与运动学习解耦为两个轻量级可训练适配器,实现灵活、高效且高保真的视频生成。
  • 通过在多样化主体-运动组合上进行广泛定性与定量实验,验证所提方法的有效性。

提出的方法

  • 该方法将视频定制分为两个阶段:主体学习与运动学习,基于主干权重冻结的预训练视频扩散模型。
  • 在主体学习阶段,首先通过文本倒置(Textual Inversion)优化文本身份,随后微调自定义身份适配器,以从输入图像中捕捉精细外观细节。
  • 在运动学习阶段,使用输入运动视频训练运动适配器,并利用 CLIP 嵌入的图像特征作为外观引导,防止学习外观特征,从而专注于运动模式的学习。
  • 推理阶段,将两个轻量级适配器结合使用,以随机选择的训练图像作为外观引导,生成具有目标运动的个性化视频。
  • 通过在所有 Transformer 层中并行使用适配器,提升性能并避免参数融合冲突。
  • 该方法避免修改原始模型权重,确保与预训练扩散模型的稳定性和兼容性。

实验结果

研究问题

  • RQ1基于扩散的视频生成模型能否有效同时定制主体身份与运动模式?
  • RQ2如何实现主体与运动定制的解耦,以提升灵活性并降低优化复杂度?
  • RQ3使用专用的身份与运动适配器是否优于 LoRA 等参数高效微调方法在视频定制任务中的表现?
  • RQ4该方法在少样本输入下,能在多大程度上保持主体身份并生成多样且准确的运动模式?
  • RQ5当处理复杂或罕见的主体-运动组合时,该方法的失败模式与局限性是什么?

主要发现

  • 通过广泛定性与定量评估验证,DreamVideo 在个性化视频生成方面优于当前最先进方法。
  • 该方法在多种上下文中成功保持了主体身份,并生成与输入运动视频高度匹配的运动模式。
  • 消融实验表明,身份适配器与运动适配器均不可或缺,移除任一组件均会导致性能显著下降。
  • 与 LoRA 相比,基于适配器的方法在视频定制任务中表现更优,尤其在避免参数融合冲突以及实现空间与时间控制的和谐结合方面优势明显。
  • 该方法在生成任意主体-运动组合(包括复杂或罕见配对)的视频方面表现出鲁棒性,尽管对高度异常或涉及多对象的组合仍存在部分失败案例。
  • 失败案例揭示了与基础模型能力相关的局限性,例如无法生成语义上罕见组合(如“狼骑自行车”)的视频,或在细粒度运动视频中实现帧级精确的运动迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。