Skip to main content
QUICK REVIEW

[论文解读] NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion

Chenfei Wu, Jian Liang|arXiv (Cornell University)|Nov 24, 2021
Multimodal Machine Learning Applications被引用 7
一句话总结

NÜWA 是一种基于 3D 变压器的统一预训练模型,利用共享的编码器-解码器架构与 3D 近邻注意力(3DNA),实现图像和视频的生成与操作,在 8 项视觉合成任务上达到最先进性能,包括文本到图像和文本到视频生成,且在操作任务中展现出强大的零样本能力。

ABSTRACT

This paper presents a unified multimodal pre-trained model called NÜWA that can generate new or manipulate existing visual data (i.e., images and videos) for various visual synthesis tasks. To cover language, image, and video at the same time for different scenarios, a 3D transformer encoder-decoder framework is designed, which can not only deal with videos as 3D data but also adapt to texts and images as 1D and 2D data, respectively. A 3D Nearby Attention (3DNA) mechanism is also proposed to consider the nature of the visual data and reduce the computational complexity. We evaluate NÜWA on 8 downstream tasks. Compared to several strong baselines, NÜWA achieves state-of-the-art results on text-to-image generation, text-to-video generation, video prediction, etc. Furthermore, it also shows surprisingly good zero-shot capabilities on text-guided image and video manipulation tasks. Project repo is https://github.com/microsoft/NUWA.

研究动机与目标

  • 开发一种统一的多模态预训练模型,能够在单一框架内处理文本、图像和视频,以应对多样化的视觉合成任务。
  • 通过引入尊重空间和时间局部性的 3D 注意力机制,解决现有自回归视觉模型计算效率低下和泛化能力有限的问题。
  • 通过利用共享的多模态预训练解码器,实现零样本文本引导的图像和视频操作。
  • 通过结合基于 VQ-GAN 的离散标记化与图像和视频数据的多任务预训练,提升视觉生成质量和可扩展性。
  • 在统一架构下统一图像和视频建模,通过在两种模态上联合预训练,增强语义和结构一致性。

提出的方法

  • 设计一种 3D 变压器编码器-解码器框架,将文本视为 1D,图像视为 2D,视频视为 3D 序列,实现在多种模态间的统一处理。
  • 提出 3D 近邻注意力(3DNA),一种稀疏注意力机制,将自注意力限制在相邻的空间和时间标记上,降低计算量的同时保留局部结构。
  • 使用 VQ-GAN 进行离散视觉标记化,替代 VQ-VAE,以提升生成质量并实现对高分辨率数据的高效预训练。
  • 在三个核心任务上实施多任务预训练:文本到图像(T2I)、文本到视频(T2V)和视频到视频(V2V),以联合学习跨模态和视频特异性表征。
  • 通过在部分输入或文本提示上进行条件控制,将同一解码器适配至 8 项下游任务,包括图像/视频生成、补全、预测和文本引导操作。
  • 应用共享的自适应编码器,处理文本或视觉草图(如 3D 草图),并将其输入共享解码器以实现生成或操作。

实验结果

研究问题

  • RQ1统一的 3D 变压器架构能否有效处理跨文本、图像和视频的多样化视觉合成任务?
  • RQ2与轴向注意力或全连接自注意力相比,3D 近邻注意力机制是否能在视频和图像生成中提升生成质量和计算效率?
  • RQ3在 T2I、T2V 和 V2V 上进行多任务预训练,能在多大程度上提升文本引导图像和视频操作的零样本性能?
  • RQ4与仅在单一模态上训练的模型相比,预训练阶段整合图像和视频数据对下游视觉合成性能有何影响?
  • RQ5在仅提供文本提示和部分输入的情况下,单一预训练模型是否能无需微调即可泛化至零样本操作任务?

主要发现

  • 在 MSR-VTT 数据集上,NÜWA 在文本到视频生成任务中实现了 47.68 的最先进 FID-vid 分数,显著优于基线模型。
  • 在 MSR-VTT 上,模型获得 0.2439 的 CLIPSIM 分数,表明生成视频与文本描述之间具有强大的语义对齐能力。
  • 通过在 T2I、T2V 和 V2V 上进行多任务预训练,NÜWA 相较于仅在 T2V 上训练,FID-vid 提升了 5.3 分,证明了联合学习的优势。
  • 3DNA 机制在降低计算复杂度的同时提升了视觉质量,VSPW 草图到视频任务中表现为 27.79 的 FID-vid 和 0.6085 的 Detected PA。
  • NÜWA 在文本引导的视频操作中展现出强大的零样本能力,仅凭一个提示即可成功生成潜水员从水下浮出、游向底部或向上飞起的视频。
  • 若将编码器或解码器替换为全连接自注意力,性能会下降,证实局部注意力对高质量生成至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。