[论文解读] Expressive Telepresence via Modular Codec Avatars
本文提出模块化编码器化身(MCA),一种新颖的方法,通过用学习到的模块化表示替代整体化人脸建模,实现超逼真、富有表现力的VR远程呈现化身。该方法独立处理来自多个头戴设备摄像头的输入,再进行自适应融合。与传统的编码器化身(CA)相比,MCA在面部表现力和鲁棒性方面均有提升,在真实世界数据集上实现了最先进性能,RMSE更低(5.48 vs. 6.67),并能更优地处理细微、未见过的表情及视角变化。
VR telepresence consists of interacting with another human in a virtual space represented by an avatar. Today most avatars are cartoon-like, but soon the technology will allow video-realistic ones. This paper aims in this direction and presents Modular Codec Avatars (MCA), a method to generate hyper-realistic faces driven by the cameras in the VR headset. MCA extends traditional Codec Avatars (CA) by replacing the holistic models with a learned modular representation. It is important to note that traditional person-specific CAs are learned from few training samples, and typically lack robustness as well as limited expressiveness when transferring facial expressions. MCAs solve these issues by learning a modulated adaptive blending of different facial components as well as an exemplar-based latent alignment. We demonstrate that MCA achieves improved expressiveness and robustness w.r.t to CA in a variety of real-world datasets and practical scenarios. Finally, we showcase new applications in VR telepresence enabled by the proposed model.
研究动机与目标
- 本文旨在超越当前整体化编码器化身(CA)模型,提升视频级真实感VR远程呈现化身的表现力与鲁棒性。
- 针对CA在缺乏训练数据时难以插值罕见或复杂面部表情,以及整体化建模刚性导致的局限性。
- 目标是开发一种模块化、数据驱动的方法,实现从少量训练样本中准确、泛化性强且感知自然的面部动画。
- 该方法旨在应对真实世界中的多样性,如光照变化、头戴设备位置差异、妆容变化及硬件差异。
提出的方法
- MCA用模块化编码器替代CA的整体化编码器,分别处理每个头戴设备摄像头的图像,生成特定部位的潜在码。
- 每个摄像头特定的潜在码被送入合成网络,该网络通过调制自适应融合估计完整人脸潜在码与融合权重。
- 合成网络采用对学习到的部位向量进行软注意力机制,动态加权不同面部组件的贡献。
- 合成网络中使用时间卷积网络以稳定时间序列上的预测,提升时间一致性。
- 模型采用基于样本的潜在码对齐技术,对齐不同表情与视角下的潜在码。
- 最终化身通过使用学习到的权重,将多个摄像头特定的人脸潜在码融合后,经共享解码器解码为3D人脸。
实验结果
研究问题
- RQ1当训练数据有限且分布不均时,面部动画模型如何实现更高表现力?
- RQ2模块化架构在应对真实世界变化(如光照、头戴设备位置、外观变化)方面的鲁棒性可提升到何种程度?
- RQ3可学习的融合机制是否能优于固定或等权重融合,在多视角人脸重建中表现更优?
- RQ4与整体化建模相比,模块化设计在感知质量与重建精度方面表现如何?
- RQ5增强面部表现力与控制能力后,哪些新的VR远程呈现应用成为可能?
主要发现
- 与CA相比,MCA在主要评估指标上实现了17.5%的相对RMSE降低(5.48 vs. 6.67),证明其重建精度更优。
- MCA在处理细微、复杂且未在训练中出现的面部表情(如眼睛半闭时张嘴、闭眼时露出牙齿)方面显著优于CA。
- 消融实验证实,软注意力机制、端到端训练以及潜在码维度扩展对性能至关重要,时间卷积与跳跃连接进一步提升结果。
- MCA在不同视角下均能生成一致且自然的面部表情,经图6多视角渲染验证。
- 该模型支持新应用,如通过随机模块置换实现灵活的表情动画与眼部增强,体现更强的可控性。
- 失败案例仅限于极端不对称或强烈背景闪光情况,表明其对大多数实际VR环境具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。