[论文解读] gDNA: Towards Generative Detailed Neural Avatars
gDNA 提出了一种生成式神经化身模型,仅需每名受试者1–3个体态扫描,即可合成多样化、细节丰富的3D着装人体化身,具备逼真且随机的褶皱效果,并实现显式的姿态控制。通过结合多受试者正向皮肤权重计算与经2D对抗训练增强的3D法向场,gDNA在生成保真度和3D扫描拟合方面达到了最先进水平。
To make 3D human avatars widely available, we must be able to generate a variety of 3D virtual humans with varied identities and shapes in arbitrary poses. This task is challenging due to the diversity of clothed body shapes, their complex articulations, and the resulting rich, yet stochastic geometric detail in clothing. Hence, current methods to represent 3D people do not provide a full generative model of people in clothing. In this paper, we propose a novel method that learns to generate detailed 3D shapes of people in a variety of garments with corresponding skinning weights. Specifically, we devise a multi-subject forward skinning module that is learned from only a few posed, un-rigged scans per subject. To capture the stochastic nature of high-frequency details in garments, we leverage an adversarial loss formulation that encourages the model to capture the underlying statistics. We provide empirical evidence that this leads to realistic generation of local details such as wrinkles. We show that our model is able to generate natural human avatars wearing diverse and detailed clothing. Furthermore, we show that our method can be used on the task of fitting human models to raw scans, outperforming the previous state-of-the-art.
研究动机与目标
- 实现多样化、细节丰富的3D着装人体化身的生成,具备完整姿态控制能力,并真实呈现高频率表面细节(如褶皱)。
- 从原始、未绑定的3D扫描中学习生成模型,无需参考形态、表面配准或手动定义的皮肤权重。
- 在单一统一的隐式表示中解耦身份、形状、运动与服装形变,以提升保真度与泛化能力。
- 同时支持新化身的生成与真实扫描的高保真拟合,在两项任务中均优于现有最先进方法。
提出的方法
- 该方法采用规范空间隐式表示,将粗略形状与高频法向细节解耦,从而实现姿态与尺寸的泛化。
- 通过每名受试者仅1–3个体态扫描,训练多受试者正向皮肤权重模块,在共享潜在空间中学习形状与皮肤权重,无需显式监督。
- 通过学习到的形变场,利用同一套皮肤权重场实现不同体型间的精确形变,提升对未见体型的泛化能力。
- 通过条件化于粗略特征的3D法向场建模高频细节(如褶皱),并利用隐式表面渲染器生成的2D法向图进行对抗训练。
- 通过渲染器建立3D-2D对应关系,将对抗损失反向传播至3D法向场,克服了UV空间方法的局限性。
- 模型通过3D重建损失与对抗损失的组合进行训练,后者特别针对服装中的逼真几何细节进行优化。
实验结果
研究问题
- RQ1生成模型能否在无任何人工监督的情况下,仅从每名受试者少量体态扫描中学习生成多样化、细节丰富的3D着装人体化身?
- RQ2如何在隐式神经表示中有效建模并生成如褶皱等随机、高频的几何细节?
- RQ3单一统一模型能否联合学习身份、形状、运动与服装形变,从而超越专用或单受试者方法?
- RQ4该模型在生成过程中对未见身份与姿态的泛化能力有多强?
- RQ5同一生成模型能否有效用于真实3D扫描的拟合,且在精度上优于现有最先进方法?
主要发现
- gDNA 实现了11.54的Fréchet身份距离(FID),显著优于基线方法(如Pose ONet的43.80与无对抗训练的Detailed Normal的42.18),证明其在生成保真度方面的卓越表现。
- 在感知研究中,78.7%的参与者更偏好真实扫描而非所有基线方法,且21.3%的生成样本被认为比真实扫描更逼真。
- 在3D扫描拟合任务中,gDNA优于最先进方法,在SIZER数据集上实现Pred-to-Scan误差0.0134与Scan-to-Pred误差0.0123,超越SMPLicit与NPMs。
- 消融研究证实对抗训练至关重要:若无对抗训练,生成形状会过度平滑或凹凸不平,高频细节将丢失。
- gDNA 成功泛化至训练期间未见的新身份,并可利用学习到的皮肤权重将拟合后的形状重新动画化至新姿态。
- 该方法能够高保真地重建复杂服装细节(如褶皱),在21.3%的情况下,用户认为生成样本比真实扫描更逼真。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。