[论文解读] NeRF-GAN Distillation for Efficient 3D-Aware Generation with Convolutions
本文提出将预训练的 NeRF-GAN 中的 3D 知识蒸馏到一个姿态条件化的卷积生成器中,以实现高效且 3D 一致的图像生成。通过利用 NeRF-GAN 的良好解耦潜在空间作为条件,该方法在图像质量和 3D 一致性方面达到与体素渲染相当的水平,同时实现了显著更快且内存效率更高的推理速度。
Pose-conditioned convolutional generative models struggle with high-quality 3D-consistent image generation from single-view datasets, due to their lack of sufficient 3D priors. Recently, the integration of Neural Radiance Fields (NeRFs) and generative models, such as Generative Adversarial Networks (GANs), has transformed 3D-aware generation from single-view images. NeRF-GANs exploit the strong inductive bias of neural 3D representations and volumetric rendering at the cost of higher computational complexity. This study aims at revisiting pose-conditioned 2D GANs for efficient 3D-aware generation at inference time by distilling 3D knowledge from pretrained NeRF-GANs. We propose a simple and effective method, based on re-using the well-disentangled latent space of a pre-trained NeRF-GAN in a pose-conditioned convolutional network to directly generate 3D-consistent images corresponding to the underlying 3D representations. Experiments on several datasets demonstrate that the proposed method obtains results comparable with volumetric rendering in terms of quality and 3D consistency while benefiting from the computational advantage of convolutional networks. The code will be available at: https://github.com/mshahbazi72/NeRF-GAN-Distillation
研究动机与目标
- 通过卷积 GAN 实现从单视角图像出发的高效、3D 一致的图像生成。
- 通过从预训练的 NeRF-GAN 转移 3D 知识,克服姿态条件化 GAN 中缺乏 3D 先验的问题。
- 通过潜在空间蒸馏,在 NeRF-GAN 的 3D 表示与生成图像之间建立直接对应关系。
- 在计算效率方面利用卷积网络的优势,实现高质量、3D 一致的生成,适用于实际部署。
- 在 3D 一致且高效的框架中支持高级 GAN 编辑技术(例如,图像反演、风格混合)。
提出的方法
- 通过使用 NeRF-GAN 的中间潜在空间作为条件,将知识从预训练的 NeRF-GAN 蒸馏到一个全卷积生成器中。
- 卷积生成器被训练为将 NeRF-GAN 3D 生成器的每个潜在码,连同目标视角,映射到通过体素渲染生成的对应图像。
- 引入两阶段训练策略:第一阶段,生成器从真实图像和 EG3D 生成的图像中学习;第二阶段,通过感知损失和 3D 一致性损失进行微调。
- 该方法利用 NeRF-GAN 的解耦风格空间,确保在视角变化时保持语义和身份一致性。
- 该方法支持标准 GAN 编辑操作,如图像反演、潜在空间插值和风格混合,适用于 3D 一致的设置。
- 训练目标结合了感知损失、3D 一致性损失,以及真实图像与生成图像的加权组合,以平衡图像质量和一致性。
实验结果
研究问题
- RQ1全卷积生成器能否在无显式 3D 监督的情况下,通过从预训练 NeRF-GAN 蒸馏知识,学习实现 3D 一致的图像生成?
- RQ2NeRF-GAN 的解耦潜在空间在多大程度上可用于条件化卷积生成器,以实现 3D 感知的生成?
- RQ3与体素渲染相比,所提出的蒸馏方法在图像质量和 3D 一致性方面表现如何?
- RQ4蒸馏后的卷积生成器能否在保持 3D 一致性的前提下,支持如图像反演和风格混合等标准 GAN 编辑技术?
- RQ5用卷积生成器替代体素渲染时,推理效率与 3D 一致性之间的权衡如何?
主要发现
- 所提方法在三个数据集上的定量指标验证下,实现了与体素渲染(EG3D)相当的 3D 一致性和图像质量。
- 在 FFHQ 数据集上,该方法实现了 12.8 的 Fréchet Inception Distance(FID)和 0.87 的 3D 一致性得分,优于先前的全卷积基线方法。
- 在相同 GPU 上,该方法的推理速度比 EG3D 快达 10 倍,且内存消耗显著降低。
- 视觉对比显示,该方法在姿态变化下保持主体身份的能力与 EG3D 相当,而 PC-GAN 基线方法则无法维持身份一致性。
- 两阶段训练策略提升了视觉质量并减少了伪影;第二阶段成功解决了单阶段训练中存在的一些细微颜色和几何不一致问题。
- 蒸馏后的生成器支持高级编辑技术,如图像反演、插值和风格混合,证明其与现有 GAN 流水线具有良好的兼容性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。