[论文解读] SCANimate: Weakly Supervised Learning of Skinned Clothed Avatar Networks
SCANimate 提出了一种弱监督框架,可直接从原始 3D 扫描数据中学习高保真、可动画化的穿衣人形化身(Scanimats),无需模板网格配准或合成数据。通过利用隐式骨骼权重场和循环一致的姿态归一化,它实现了基于局部姿态条件的姿势相关服装形变建模,相较于最先进方法,在真实感和泛化能力方面表现更优。
We present SCANimate, an end-to-end trainable framework that takes raw 3D scans of a clothed human and turns them into an animatable avatar. These avatars are driven by pose parameters and have realistic clothing that moves and deforms naturally. SCANimate does not rely on a customized mesh template or surface mesh registration. We observe that fitting a parametric 3D body model, like SMPL, to a clothed human scan is tractable while surface registration of the body topology to the scan is often not, because clothing can deviate significantly from the body shape. We also observe that articulated transformations are invertible, resulting in geometric cycle consistency in the posed and unposed shapes. These observations lead us to a weakly supervised learning method that aligns scans into a canonical pose by disentangling articulated deformations without template-based surface registration. Furthermore, to complete missing regions in the aligned scans while modeling pose-dependent deformations, we introduce a locally pose-aware implicit function that learns to complete and model geometry with learned pose correctives. In contrast to commonly used global pose embeddings, our local pose conditioning significantly reduces long-range spurious correlations and improves generalization to unseen poses, especially when training data is limited. Our method can be applied to pose-aware appearance modeling to generate a fully textured avatar. We demonstrate our approach on various clothing types with different amounts of training data, outperforming existing solutions and other variants in terms of fidelity and generality in every setting. The code is available at https://scanimate.is.tue.mpg.de.
研究动机与目标
- 实现从原始 3D 扫描数据端到端学习可动画化的穿衣人形化身,无需表面配准到模板网格或使用定制模板。
- 在不依赖合成模拟数据的情况下,建模复杂且逼真的服装形变(如褶皱和滑动效应)。
- 通过学习基于局部而非全局的姿态条件形变,实现对未见姿态的泛化能力。
- 通过将隐式形状表示扩展至外观建模,实现无需 2D 纹理映射的完整纹理化身生成。
- 克服现有方法依赖固定拓扑模板或因独立部件建模导致伪影的局限性。
提出的方法
- 该方法使用神经隐式函数回归 3D 空间中的连续骨骼权重,实现无需网格拓扑假设的姿势到归一化姿态及反向变换。
- 通过训练逆线性骨骼权重(LBS)函数在正向和反向变换后重建原始扫描,强制实现几何循环一致性,为骨骼权重学习提供弱监督。
- 采用局部姿态感知的隐式函数,学习补全缺失几何并建模姿态相关的形变,相比全局姿态嵌入,能有效减少长距离的虚假相关性。
- 通过使用学习到的隐式骨骼权重场将扫描数据归一化到统一姿态,实现刚性形变与形状的解耦。
- 通过预测神经纹理场,将方法扩展至外观建模,实现无需 2D UV 映射的高分辨率、3D 感知渲染。
- 该方法在包含自相交、孔洞和噪声的原始扫描上进行端到端训练,仅使用 SMPL 姿态参数作为监督信号。
实验结果
研究问题
- RQ1我们能否直接从原始 3D 扫描数据中学习参数化、可动画化的穿衣人形化身,而无需将表面配准到模板网格?
- RQ2在缺乏合成或标注训练数据的情况下,我们能否实现准确、一致且逼真的服装形变建模?
- RQ3在训练数据有限的情况下,局部姿态条件是否优于全局姿态嵌入,从而在泛化到未见姿态方面表现更优?
- RQ4我们能否在保留衣物抬起等拓扑变化的前提下,从未结构化、噪声大且不完整的 3D 扫描中实现高保真度的形状与外观重建?
- RQ5我们能否训练一个完全可微、端到端的系统,仅通过姿态监督从真实世界扫描中同时学习几何与纹理?
主要发现
- 在野外基准测试中,SCANimate 的形状到网格平均距离为 0.570 mm,优于 CAPE(0.970 mm)和 NASA(1.12 mm),表明其重建精度更优。
- 在野外数据集上的感知图像质量得分(Pi)达到 0.50,显著优于 CAPE(0.268)和 NASA(0.432),证明其视觉真实感更优。
- 在野外数据集上,感知体积分数(Pv)为 0.50,表明 SCANimate 保持了全局一致性,避免了因独立部件建模而产生的常见伪影。
- 在外推任务中,SCANimate 在泛化到未见姿态方面优于 CAPE 和 NASA,伪影更少,形变模式更一致。
- 该方法成功建模了复杂且拓扑多变的服装(如存在抬起和褶皱的夹克),而 CAPE 因固定拓扑约束而无法捕捉此类形变。
- 纹理建模的扩展实现了无需 2D UV 映射的高分辨率、3D 感知纹理预测,支持 Scanimats 的逼真渲染。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。