[论文解读] SplatArmor: Articulated Gaussian splatting for animatable humans from monocular RGB videos
SplatArmor 提出了一种新颖的方法,通过将 3D 高斯分布锚定到标准 SMPL 人体模型上,从单目 RGB 视频中创建细节丰富且可动画化的 3D 人体化身。它使用基于姿态的 SE(3) 场进行前向皮肤绑定,并结合神经颜色场实现 3D 监督,实现了在新视角和新姿态合成方面的最先进性能,仅需 9GB 显存下 7 小时的训练时间,且支持实时推理。
We propose SplatArmor, a novel approach for recovering detailed and animatable human models by `armoring' a parameterized body model with 3D Gaussians. Our approach represents the human as a set of 3D Gaussians within a canonical space, whose articulation is defined by extending the skinning of the underlying SMPL geometry to arbitrary locations in the canonical space. To account for pose-dependent effects, we introduce a SE(3) field, which allows us to capture both the location and anisotropy of the Gaussians. Furthermore, we propose the use of a neural color field to provide color regularization and 3D supervision for the precise positioning of these Gaussians. We show that Gaussian splatting provides an interesting alternative to neural rendering based methods by leverging a rasterization primitive without facing any of the non-differentiability and optimization challenges typically faced in such approaches. The rasterization paradigms allows us to leverage forward skinning, and does not suffer from the ambiguities associated with inverse skinning and warping. We show compelling results on the ZJU MoCap and People Snapshot datasets, which underscore the effectiveness of our method for controllable human synthesis.
研究动机与目标
- 从单目 RGB 视频中生成高保真、可动画化的 3D 人体化身,且无需标记系统。
- 克服基于网格和 NeRF 方法在拓扑约束、优化难度以及姿态依赖几何建模方面的局限性。
- 利用高斯点绘图实现更快、可微分的渲染,同时避免反向皮肤绑定和形变中的歧义性。
- 在计算成本极低的前提下实现高保真度的精确新视角与新姿态合成。
- 通过神经颜色场提供 3D 监督与颜色正则化,以实现高斯位置与外观的精确定位。
提出的方法
- 将人体表示为规范空间中的一组 3D 高斯分布,通过将 SMPL 皮肤绑定扩展至任意规范位置来定义运动结构。
- 引入 SE(3) 场以建模姿态依赖的变换,捕捉观测空间中高斯分布的位置与各向异性特性。
- 使用神经颜色场对高斯颜色进行正则化,并提供 3D 监督以实现精确的空间定位。
- 采用前向皮肤绑定将规范空间中的高斯分布映射到观测空间,避免反向皮肤绑定与形变中的歧义性。
- 采用预训练方案,通过视觉轮廓估计与颜色场初始化提升收敛性并减少伪影。
- 在训练过程中优化每帧的姿态,同时利用可学习的 MLP 实现非刚性、姿态依赖的形变。
实验结果
研究问题
- RQ1锚定在规范 SMPL 模型上的 3D 高斯分布能否实现从单目 RGB 视频中高保真、可动画化的 3D 人体重建?
- RQ2与反向皮肤绑定相比,基于高斯的前向皮肤绑定在鲁棒性与伪影抑制方面是否更具优势?
- RQ3神经颜色场能否在无显式 3D 监督的情况下,有效正则化高斯颜色并提供 3D 监督?
- RQ4与基于 NeRF 的基线方法相比,该方法在训练效率与推理速度方面表现如何?
- RQ5该方法在未见姿态与视角下的泛化能力如何,是否会出现过拟合或引入伪影?
主要发现
- 在 ZJU MoCap 数据集上,SplatArmor 的 PSNR 达到 31.94,LPIPS 为 26.08,在新视角与新姿态合成任务中全面优于所有基线方法。
- 消融实验表明,若移除神经颜色场,PSNR 下降 5.86,LPIPS 上升 5.86,证实其在抑制伪影方面具有关键作用。
- 对视觉轮廓与颜色场进行预训练可显著减少新姿态下的伪影,而无预训练版本的重建质量明显下降。
- 该方法在 9GB 显存下仅需 7 小时训练,远快于 HumanNeRF(48GB 显存下需 3 天)与 AnimNeRF(15 小时),同时支持实时推理。
- 姿态依赖 MLP 的刚性(R)变体在准确度与过度补偿之间取得最佳平衡,优于仅平移与仿射变体。
- 失败案例表现为在未见区域或自阴影区域出现更暗的纹理,这是由于缺乏视点依赖的颜色建模,表明其在外观建模方面仍存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。