Skip to main content
QUICK REVIEW

[论文解读] Few-shot Video-to-Video Synthesis

Ting-Chun Wang, Ming-Yu Liu|arXiv (Cornell University)|Oct 28, 2019
Advanced Vision and Imaging参考文献 64被引用 8
一句话总结

本文提出了一种少样本视频到视频合成方法,通过从单张参考图像生成高质量的视频帧,利用学习到的自适应卷积权重。通过在各层之间重用特征,并采用注意力机制融合多张示例图像,该模型在极短的推理时间内实现了最先进性能,优于需要为每个主体进行大量训练的方法。

ABSTRACT

Video-to-video synthesis (vid2vid) aims at converting an input semantic video, such as videos of human poses or segmentation masks, to an output photorealistic video. While the state-of-the-art of vid2vid has advanced significantly, existing approaches share two major limitations. First, they are data-hungry. Numerous images of a target human subject or a scene are required for training. Second, a learned model has limited generalization capability. A pose-to-human vid2vid model can only synthesize poses of the single person in the training set. It does not generalize to other humans that are not in the training set. To address the limitations, we propose a few-shot vid2vid framework, which learns to synthesize videos of previously unseen subjects or scenes by leveraging few example images of the target at test time. Our model achieves this few-shot generalization capability via a novel network weight generation module utilizing an attention mechanism. We conduct extensive experimental validations with comparisons to strong baselines using several large-scale video datasets including human-dancing videos, talking-head videos, and street-scene videos. The experimental results verify the effectiveness of the proposed framework in addressing the two limitations of existing vid2vid approaches.

研究动机与目标

  • 仅使用一张参考图像实现高保真度的视频到视频合成,减少对每个主体大规模训练的依赖。
  • 克服现有方法在每个个体上需要大量训练数据和时间的局限性,例如 vid2vid 和 Zhou 等人(2019)。
  • 开发一种可泛化的、推理速度快的框架,能够从单张示例图像自适应地生成卷积核权重。
  • 通过特征重用和注意力机制学习空间自适应的动态卷积核,提升生成结果的视觉质量和多样性。

提出的方法

  • 该方法通过重用前一层的特征来生成仿射参数,改进了特征在各层之间的连续性,从而对 SPADE 生成器进行了修改。
  • 引入可学习的权重生成机制,其中参考图像的特征通过自适应池化(AdaPool)编码,并通过全连接层生成卷积核权重。
  • 引入注意力机制,通过学习软性空间图来融合来自多张示例图像的特征,以确定每个输出位置中来自哪张示例图像的哪个空间位置贡献最大。
  • 生成的权重被用于 SPADE 层,以生成空间自适应的归一化参数,实现内容感知的特征调制。
  • 该方法在表达能力上超越 AdaIN,支持更大的卷积核尺寸和分组归一化,从而提升表达能力和灵活性。
  • 模型端到端进行训练,并可在单张示例图像下实现接近实时的推理。

实验结果

研究问题

  • RQ1是否可以仅使用一张参考图像有效实现视频到视频的合成,而无需对每个主体进行微调?
  • RQ2与固定归一化方法(如 AdaIN)相比,自适应权重生成在视觉质量和表达能力方面表现如何?
  • RQ3融合多张示例图像的注意力机制在多大程度上提升了合成质量与泛化能力?
  • RQ4随着数据集规模的增加,该方法的性能如何变化?当训练数据增长时,其性能是否保持稳定?
  • RQ5当测试域与训练域显著不同时,例如 CG 角色,该方法是否能泛化到未见过的领域?

主要发现

  • 即使仅使用一张示例图像,该方法在视觉质量上仍可与 vid2vid 及其他基线方法相媲美或更优,展现出强大的少样本泛化能力。
  • 在额外示例图像上进行微调后,模型性能超越了基线方法,表明其具备强大的适应能力。
  • 注意力机制显著提升了合成质量,使模型能够关注多张示例图像中的相关身体部位,如正面和背面视图。
  • 所提出的权重生成方案在数据集规模增大时优于 AdaIN,因其具有更高的表达能力并能生成更大的卷积核。
  • 人类评估显示偏好得分显著高于 0.5(基于 60,000 次评估),证实了该方法在感知质量上的优越性。
  • 当面对与训练数据差异过大的领域(如 CG 角色)时,模型表现失败,表明其在零样本领域泛化方面存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。