Skip to main content
QUICK REVIEW

[论文解读] Animatable and Relightable Gaussians for High-fidelity Human Avatar Modeling

Zhe Li, Sun, Yipengjing|arXiv (Cornell University)|Nov 27, 2023
Human Pose and Action Recognition被引用 5
一句话总结

本文提出了一种名为可动画高斯(Animatable Gaussians)的新颖3D角色表征方法,通过在前/后标准视图上采用模板引导的参数化方式,将3D高斯溅射与2D卷积神经网络(CNN)相结合,以建模高保真、姿态相关的真人外观。通过学习角色特定的参数化模板,并使用基于StyleGAN的生成器结合主成分分析(PCA)的姿态投影,该方法实现了从多视角RGB视频中生成逼真、动态且可泛化的角色动画,其在保真度和推理速度方面优于以往基于NeRF和隐式表示的方法。

ABSTRACT

Modeling animatable human avatars from RGB videos is a long-standing and challenging problem. Recent works usually adopt MLP-based neural radiance fields (NeRF) to represent 3D humans, but it remains difficult for pure MLPs to regress pose-dependent garment details. To this end, we introduce Animatable Gaussians, a new avatar representation that leverages powerful 2D CNNs and 3D Gaussian splatting to create high-fidelity avatars. To associate 3D Gaussians with the animatable avatar, we learn a parametric template from the input videos, and then parameterize the template on two front & back canonical Gaussian maps where each pixel represents a 3D Gaussian. The learned template is adaptive to the wearing garments for modeling looser clothes like dresses. Such template-guided 2D parameterization enables us to employ a powerful StyleGAN-based CNN to learn the pose-dependent Gaussian maps for modeling detailed dynamic appearances. Furthermore, we introduce a pose projection strategy for better generalization given novel poses. To tackle the realistic relighting of animatable avatars, we introduce physically-based rendering into the avatar representation for decomposing avatar materials and environment illumination. Overall, our method can create lifelike avatars with dynamic, realistic, generalized and relightable appearances. Experiments show that our method outperforms other state-of-the-art approaches.

研究动机与目标

  • 为解决从多视角RGB视频中建模高保真、姿态相关的真人角色的挑战,特别是针对如连衣裙等松身衣物。
  • 克服基于MLP的NeRF在捕捉细节丰富、动态外观时因谱偏差和低频归纳偏差导致的局限性。
  • 通过结合显式3D高斯溅射与强大的2D卷积神经网络,实现实时、高效的动画生成,同时保持高视觉保真度。
  • 通过一种姿态投影策略,提升对新姿态的泛化能力,从而对分布外的姿态信号进行正则化。
  • 开发一种支持2D网络兼容性的同时,保持时间一致性与几何保真度的参数化方案。

提出的方法

  • 通过基于SMPL的皮肤权重从输入视频重建角色特定的参数化模板,实现对连衣裙等松身衣物的精确建模。
  • 通过正交投影将3D高斯参数化到前/后标准视图上,形成两个2D高斯图,其中每个像素对应一个具有位置、协方差、不透明度和颜色的3D高斯。
  • 基于StyleUNet的条件生成器通过条件化于从模板导出的姿态位置图,学习姿态相关的高斯图。
  • 提出一种基于主成分分析(PCA)的姿态投影策略,将新姿态信号投影到训练分布空间中,实现对未见姿态的稳定且逼真的插值。
  • 最终通过3D高斯溅射渲染角色,利用学习到的2D图与姿态条件属性实现实时、高质量的渲染。
  • 该方法将显式几何(高斯)与强大的2D卷积神经网络相结合,避免了隐式表示中基于坐标MLP的归纳偏差。

实验结果

研究问题

  • RQ1显式3D高斯溅射与2D卷积神经网络的结合是否能在建模细节丰富、动态的人体外观方面超越基于MLP的隐式NeRF方法?
  • RQ2如何利用参数化模板在保持可动画性与几何一致性的同时,对长裙等通用衣物进行建模?
  • RQ32D卷积神经网络相较于基于坐标的MLP,在表示姿态相关细节方面能提升多少?
  • RQ4基于PCA的姿态投影策略是否能有效泛化到未见的、分布外的姿态,且不降低视觉质量?
  • RQ5所提出的方法是否能在保持高保真、动态且可光照重演的渲染质量的同时,实现实时推理?

主要发现

  • 该方法在视觉保真度与动态外观建模方面达到当前最优性能,尤其在连衣裙等松身衣物的处理上表现突出,而这些衣物在SMPL模板中难以准确建模。
  • 消融实验证实,角色特定的参数化模板相比SMPL-X显著提升了重建质量,尤其在非刚性、非紧凑衣物上表现更优。
  • 将2D卷积神经网络(StyleUNet)替换为基于坐标的MLP后,生成的动画变得模糊且细节减少,证明了CNN在捕捉精细、姿态相关的外观细节方面具有明显优势。
  • 通过PCA的姿态投影策略减少了伪影,提升了新姿态下的视觉质量,定性结果表明3D高斯结构更加合理且一致。
  • 该方法在单张RTX 3090上实现了25 FPS的推理速度,显著优于以往方法(如TAVA为0.003 FPS,AvatarReX为10 FPS,使用TensorRT优化)。
  • 模板引导的2D参数化与3D高斯溅射的结合,实现了高质量、实时的渲染,可在多种姿态下保持细节丰富、动态且泛化的外观表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。