Skip to main content
QUICK REVIEW

[论文解读] 3D-Aware Video Generation

Sherwin Bahmani, Jeong Joon Park|arXiv (Cornell University)|Jun 29, 2022
Generative Adversarial Networks and Image Synthesis被引用 8
一句话总结

该论文提出了首个4D生成对抗网络(GAN),能够仅从单目2D视频中学习生成具有3D感知能力的视频,采用神经隐式表示和时间感知判别器。通过在潜在空间中解耦身份与运动,该模型能够合成高质量、视角一致的3D视频,支持可控的相机视角和合理的运动,其性能在与最先进2D视频GAN的对比中表现优异。

ABSTRACT

Generative models have emerged as an essential building block for many image synthesis and editing tasks. Recent advances in this field have also enabled high-quality 3D or video content to be generated that exhibits either multi-view or temporal consistency. With our work, we explore 4D generative adversarial networks (GANs) that learn unconditional generation of 3D-aware videos. By combining neural implicit representations with time-aware discriminator, we develop a GAN framework that synthesizes 3D video supervised only with monocular videos. We show that our method learns a rich embedding of decomposable 3D structures and motions that enables new visual effects of spatio-temporal renderings while producing imagery with quality comparable to that of existing 3D or video GANs.

研究动机与目标

  • 开发一种4D GAN,仅使用单视角2D视频作为监督信号,无需多视角或3D监督,即可生成具有3D感知能力的视频。
  • 通过学习解耦的3D身份与运动表征,实现对时空渲染的可控性。
  • 通过新型时间感知判别器,实现生成3D视频在多视角和时间上的一致性。
  • 证明仅使用单目监督即可实现3D感知视频生成,并在视角一致性方面优于现有2D视频GAN。

提出的方法

  • 生成器使用4D神经隐式场,可在任意$xyzt$坐标处查询,表示随时间演化的连续3D场景。
  • 采用两个独立的潜在码:一个用于3D身份,一个用于运动,实现形状与动态的解耦生成。
  • 时间感知判别器通过比较同一视频序列中随机采样的两帧及其时间差,评估生成结果的真实性。
  • 模型通过对抗性损失进行训练,以促使生成器从任意相机视角生成逼真的视频帧。
  • 在FFHQ上进行预训练以提升多视角一致性,随后在FaceForensics上进行微调以学习运动。
  • 在视频判别器之外额外使用图像判别器,以提升图像质量,显著改善FVD分数。

实验结果

研究问题

  • RQ1能否仅使用单目2D视频数据作为监督信号,训练出一个4D GAN来生成具有3D感知能力的视频?
  • RQ2在无显式3D监督的情况下,如何在4D生成模型中强制实现时间一致性和多视角一致性?
  • RQ3使用时间感知判别器对3D视频生成中的运动真实感和视频质量有何影响?
  • RQ4解耦的身份与运动潜在表征是否能提升3D视频合成的可控性与质量?
  • RQ5在高质量图像数据集(如FFHQ)上进行预训练,如何影响生成3D视频的多视角一致性和真实感?

主要发现

  • 预训练模型在FaceForensics上取得127.2的FVD分数和0.982的ID分数,表明具有强大的多视角一致性和逼真的运动。
  • 使用独立图像判别器可将FVD分数降低至158.3,显著优于使用退化视频判别器(190.9)或不使用图像判别器(234.3)的情况。
  • 在运动生成器中采用简单乘法方式处理时间信息的模型取得最低FVD(158.3),优于位置编码(175.4)和拼接(164.7)。
  • 在FFHQ和FaceForensics上同时进行训练导致多视角一致性更差(ID = 0.893),相较于预训练策略,表明存在冲突的优化目标。
  • 定性结果表明,与基线模型相比,该模型生成的图像更清晰,视角范围更广,尤其在俯仰角和仰角方向表现更优,尽管色彩鲜艳度略有下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。