[论文解读] GRAM: Generative Radiance Manifolds for 3D-Aware Image Generation
GRAM 提出了一种新颖的3D感知图像生成框架,该框架在隐式2D流形上学习辐射场,而非体素空间,从而实现高保真度、视角可控的图像合成,并具备出色的3D一致性。通过仅在射线-表面交点处采样,它消除了蒙特卡洛噪声,仅使用6个表面即实现了SOTA级FID分数(25.8),甚至优于使用每条射线48个采样点的NeRF-H。
3D-aware image generative modeling aims to generate 3D-consistent images with explicitly controllable camera poses. Recent works have shown promising results by training neural radiance field (NeRF) generators on unstructured 2D images, but still can not generate highly-realistic images with fine details. A critical reason is that the high memory and computation cost of volumetric representation learning greatly restricts the number of point samples for radiance integration during training. Deficient sampling not only limits the expressive power of the generator to handle fine details but also impedes effective GAN training due to the noise caused by unstable Monte Carlo sampling. We propose a novel approach that regulates point sampling and radiance field learning on 2D manifolds, embodied as a set of learned implicit surfaces in the 3D volume. For each viewing ray, we calculate ray-surface intersections and accumulate their radiance generated by the network. By training and rendering such radiance manifolds, our generator can produce high quality images with realistic fine details and strong visual 3D consistency.
研究动机与目标
- 通过提升细节保真度与3D一致性,弥合2D GAN与3D感知生成模型之间的图像质量差距。
- 克服因体素辐射场中蒙特卡洛采样不足而导致的GAN训练不稳定与噪声问题。
- 通过将采样与辐射场学习限制在2D隐式流形上,降低体素渲染的计算与内存开销。
- 通过预先提取表面并将其上存储的辐射场用于渲染,实现实时多视角渲染。
- 尽管每条射线的采样点远少于以往方法,仍实现对先前基于NeRF的GAN模型的性能超越。
提出的方法
- 通过轻量级MLP在3D标量场中定义一组隐式2D流形(等值面),并共享于一类物体。
- 执行可微分的射线-表面相交计算,以确定每条观察射线上的采样点。
- 利用独立的MLP进行辐射场预测,对交点处的辐射值进行累积,从而支持端到端的GAN训练。
- 采用受StyleGAN2启发的改进网络架构,移除渐进式生长策略,以提升训练稳定性和图像质量。
- 引入真实图像的姿态监督以稳定训练,尤其在使用分层采样时效果显著。
- 在推理阶段使用移动立方体算法预先提取表面,并通过网格光栅化器渲染图像,实现180 FPS的实时自由视角渲染。
实验结果
研究问题
- RQ1能否有效将辐射场学习约束在2D流形上,以提升3D感知GAN中细节保真度并减少采样噪声?
- RQ2使用少量隐式表面(如6个)是否能在图像质量与3D一致性方面优于使用大量采样点(如48个)的体素采样?
- RQ3移除渐进式生长并增加跳跃连接对3D感知GAN的训练稳定性和生成质量有何影响?
- RQ4姿态监督在多大程度上提升了辐射场流形学习的稳定性和质量?
- RQ5辐射场流形能否在不损失图像质量的前提下实现实时多视角渲染?
主要发现
- GRAM在FFHQ数据集上仅使用6个学习到的表面即实现25.8的FID分数,优于NeRF-H(FID 30.0),即使后者使用每条射线48个采样点。
- 即使在极端采样约束下,该方法仍能生成无噪声图像,而NeRF-H在采样点少于12个时会显现出明显的噪声模式。
- 移除渐进式生长并增加跳跃连接后,FID从30.6(基线)降至25.8,证明了新训练策略的有效性。
- 姿态正则化显著提升了训练稳定性:若无真实姿态引导,NeRF-H完全失效,而GRAM保持高性能。
- GRAM通过预先提取表面并使用网格光栅化器,实现在V100 GPU上180 FPS的实时自由视角渲染。
- 该方法能生成高度逼真的精细细节(如面部纹理、细长结构),且在不同视角间保持一致,无采样噪声引起的伪影。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。