[论文解读] CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects
CustomVideo 提出了一种新颖的文本到视频生成框架,能够实现高保真度、身份保持的视频合成,且可由多个主体进行引导。该方法通过共现训练和掩码引导的注意力控制,在潜在空间中解耦主体,显著优于先前方法在多主体生成任务中的表现,包括在视觉相似对象和复杂场景下的表现。
Customized text-to-video generation aims to generate high-quality videos guided by text prompts and subject references. Current approaches for personalizing text-to-video generation suffer from tackling multiple subjects, which is a more challenging and practical scenario. In this work, our aim is to promote multi-subject guided text-to-video customization. We propose CustomVideo, a novel framework that can generate identity-preserving videos with the guidance of multiple subjects. To be specific, firstly, we encourage the co-occurrence of multiple subjects via composing them in a single image. Further, upon a basic text-to-video diffusion model, we design a simple yet effective attention control strategy to disentangle different subjects in the latent space of diffusion model. Moreover, to help the model focus on the specific area of the object, we segment the object from given reference images and provide a corresponding object mask for attention learning. Also, we collect a multi-subject text-to-video generation dataset as a comprehensive benchmark. Extensive qualitative, quantitative, and user study results demonstrate the superiority of our method compared to previous state-of-the-art approaches. The project page is https://kyfafyd.wang/projects/customvideo.
研究动机与目标
- 解决在现有文本到视频模型中研究不足的多定制主体生成高质量视频的挑战。
- 克服先前方法在确保多个主体一致共现方面存在的局限,尤其是在处理视觉相似对象时的困难。
- 通过改进潜在空间中主体的解耦,以在视频生成过程中保持身份和运动保真度。
- 构建一个全面的基准数据集,用于在多样化的主体类别和复杂组合下评估多主体文本到视频生成。
- 通过定性、定量分析和用户研究评估,证明本方法在性能上优于当前最先进方法。
提出的方法
- 在训练过程中将多个主体组合成单张图像,以促进其在生成视频中的一致共现。
- 实现一种掩码引导的注意力控制机制,利用真实物体掩码在交叉注意力图中突出显示主体区域。
- 优化交叉注意力图,通过将非目标主体区域的注意力值推向负值,以抑制无关图像区域。
- 仅微调 UNet 中交叉注意力层的查询和值权重,使用 LoRA 实现高效微调。
- 使用主体类别的名称初始化可学习的文本标记,使其与身份表征对齐。
- 从 UNet 的注意力模块第三层提取交叉注意力图,因其在消融实验中表现最优。
实验结果
研究问题
- RQ1能否有效微调一个文本到视频扩散模型,以实现多个主体在视频中的一致共现?
- RQ2当存在多个相似或复杂的主体时,如何改进潜在空间中的主体解耦?
- RQ3掩码引导的注意力控制在多大程度上能增强身份保持并减少主体之间的干扰?
- RQ4与当前最先进方法相比,该方法在文本对齐、图像对齐和时间一致性方面的表现如何?
- RQ5新构建的多样化基准数据集能否有效评估在具有挑战性的主体配对下的多主体文本到视频生成?
主要发现
- 当使用 ℓ₃ 层的交叉注意力图时,CustomVideo 在 CLIP-T 上达到 0.7051,在 DINO-I 上达到 0.3955,优于其他注意力层配置。
- 在人类评估中,该方法的用户偏好得分比先前的 SOTA 方法高出 3 倍,展现出优异的感知质量。
- CustomVideo 在所有帧中成功保持了高度相似主体(如猫与狗)的身份,避免了 VideoDreamer 中出现的身份不一致问题。
- 该模型在复杂场景中表现出良好的泛化能力,例如前景物体(如汽车)与背景场景(如谷仓)的组合,而此前方法难以处理此类情况。
- 消融实验证实,ℓ₃ 层的交叉注意力图在分辨率与性能之间实现了最佳平衡,相比 ℓ₁ 和 ℓ₄ 层,DINO-I 提升了 12%。
- CustomVideo 在所有指标(CLIP-T、CLIP-I、DINO-I 和时间一致性)上均优于 VideoDreamer 和其他 SOTA 方法,且在用户研究中表现出统计显著的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。