[论文解读] Towards Disentangled Representations for Human Retargeting by Multi-view Learning
本文提出一种多视角条件变分自编码器(CVAE),通过利用图像、关键点和姿态作为互补视角,学习解耦的、与身份无关的表征,用于人体重定向。通过在这些视角之间强制潜在空间一致性,该模型在保留表情和姿态语义的同时,摒弃了与身份相关的属性,在人脸和身体重定向任务中实现了最先进的语义保留和重建质量表现。
We study the problem of learning disentangled representations for data across multiple domains and its applications in human retargeting. Our goal is to map an input image to an identity-invariant latent representation that captures intrinsic factors such as expressions and poses. To this end, we present a novel multi-view learning approach that leverages various data sources such as images, keypoints, and poses. Our model consists of multiple id-conditioned VAEs for different views of the data. During training, we encourage the latent embeddings to be consistent across these views. Our observation is that auxiliary data like keypoints and poses contain critical, id-agnostic semantic information, and it is easier to train a disentangling CVAE on these simpler views to separate such semantics from other id-specific attributes. We show that training multi-view CVAEs and encourage latent-consistency guides the image encoding to preserve the semantics of expressions and poses, leading to improved disentangled representations and better human retargeting results.
研究动机与目标
- 从未配对的多源数据(如图像、关键点和姿态)中学习解耦的、与身份无关的表征。
- 通过保留表情和姿态等内在属性,提升身份互换过程中的重定向性能。
- 解决现有方法在图像翻译过程中因对抗正则化而丢失语义内容的局限性。
- 证明辅助视角(如关键点)可通过更有效地编码领域不变语义,简化解耦过程。
- 通过共享潜在空间实现实时VR中3D虚拟化身的驱动,将一位用户的面部和眼部动作传递到另一位用户。
提出的方法
- 为不同数据视角(图像、2D关键点、3D姿态)训练多个以身份为条件的VAE,每个视角编码领域不变的语义。
- 通过对比损失最小化不同视角编码表征之间的距离,强制实现潜在空间一致性。
- 使用带身份标签的条件VAE,将与身份相关的属性与共享语义因子(如表情和姿态)解耦。
- 利用辅助数据(如检测到的关键点)作为简化且语义丰富的视角,引导解耦并减少歧义。
- 将解耦的潜在空间与回归头结合,将编码特征映射到3D虚拟化身参数,用于实时VR应用。
- 应用循环一致性损失和身份分类损失,以提升图像重建质量和域迁移性能。
实验结果
研究问题
- RQ1利用关键点和姿态等辅助数据进行多视角学习,能否提升基于图像表征中与身份无关语义的解耦?
- RQ2在多个视角之间强制潜在空间一致性,是否能更有效地在身份迁移过程中保留表情和姿态?
- RQ3与基线方法(如CycleGAN和UFDN)相比,所提出的多视角CVAE在语义保真度和重建质量方面表现如何?
- RQ4从未配对数据中学习到的解耦表征,能否有效用于实时VR应用中驱动3D虚拟化身?
- RQ5潜在空间中的对抗正则化在多大程度上会损害领域内语义内容(如面部表情)的保留?
主要发现
- 与真实表情标签相比,所提方法的ℓ₂误差最低(0.76),优于CycleGAN(0.82)、UFDN(2.21)和基于图像的CVAE基线(1.15)。
- t-SNE可视化表明,模型的潜在表征按表情聚类,且对身份具有不变性,而CVAE基线未能清晰分离表情。
- 模型实现了0.51的重建误差(AE)和0.36的分类误差,表明图像质量高且身份转移准确。
- 该方法成功实现了通过共享的、与身份无关的潜在空间,将一位用户的面部和眼部动作实时传递到另一位用户,实现VR中3D虚拟化身的实时驱动。
- 多视角监督显著提升了语义保留效果,表现为更低的ℓ₂误差和更清晰的表情t-SNE聚类。
- 发现在潜在空间中使用对抗正则化会损害语义保真度,尤其对表情影响显著,凸显了多视角一致性损失的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。