[论文解读] ZeroEGGS: Zero-shot Example-based Gesture Generation from Speech
ZeroEGGS 是一种用于语音驱动全身动作生成的神经框架,可通过仅提供一个简短的动作示例片段实现零样本风格控制,而无需针对该风格进行预先训练。它使用变分自编码器在潜在空间中学习解耦的风格嵌入,从而实现灵活的风格操作、混合以及多样且自然的动作生成。
We present ZeroEGGS, a neural network framework for speech-driven gesture generation with zero-shot style control by example. This means style can be controlled via only a short example motion clip, even for motion styles unseen during training. Our model uses a Variational framework to learn a style embedding, making it easy to modify style through latent space manipulation or blending and scaling of style embeddings. The probabilistic nature of our framework further enables the generation of a variety of outputs given the same input, addressing the stochastic nature of gesture motion. In a series of experiments, we first demonstrate the flexibility and generalizability of our model to new speakers and styles. In a user study, we then show that our model outperforms previous state-of-the-art techniques in naturalness of motion, appropriateness for speech, and style portrayal. Finally, we release a high-quality dataset of full-body gesture motion including fingers, with speech, spanning across 19 different styles.
研究动机与目标
- 解决从语音生成富有表现力且具有风格的全身动作的挑战,使其能够泛化至未见过的说话人和动作风格。
- 通过简短的示例片段实现风格控制,而非依赖手工设计的标签或大量训练数据。
- 在潜在空间中学习解耦且有意义的风格表征,以支持灵活的操作与插值。
- 通过概率生成框架生成多样、自然且与语音匹配的动作。
- 发布一个高质量、多风格、带同步语音的全身动作数据集,以支持研究的可复现性。
提出的方法
- 使用条件变分自编码器(VAE)从简短的动作示例片段中学习解耦的风格嵌入。
- 通过原始频谱音频特征将动作生成条件化于语音输入,从而增强对说话人和语言差异的鲁棒性。
- 在潜在空间中,允许对风格嵌入进行混合、缩放或插值,以生成新颖的风格组合。
- 通过重采样潜在空间生成相同语音输入下的多样化动作输出,以捕捉人类动作中的随机性。
- 应用针对动作的损失函数,以确保生成的动画平滑、稳定且外观自然。
- 在大规模数据集上端到端训练,该数据集包含19种不同的动作风格,且带有同步的语音和全身动作(包括手指动作)。
实验结果
研究问题
- RQ1在仅使用一个示例片段进行风格条件化的情况下,该动作生成模型是否能无需重新训练即可泛化至未见过的动作风格?
- RQ2与手工设计的统计量或标签相比,基于示例的风格控制在捕捉细微且富有表现力的动作风格方面效果如何?
- RQ3在潜在空间中学习到的风格嵌入在多大程度上支持有意义的操作,如风格间的混合或插值?
- RQ4与确定性基线相比,概率生成框架是否能提升动作输出的多样性和自然度?
- RQ5在主观评估中,该模型在未见过的说话人、语言和动作风格上的表现如何?
主要发现
- ZeroEGGS 在所有主观评估指标上均优于最先进基线模型(MG):在自身数据集上的自然度(56.3 ± 22.2)、语音适配性(48.9 ± 20.3)和风格表现力(58.1 ± 25.9)。
- 在 TSG 数据集上,该模型取得了 61.9 ± 23.3 的风格表现力得分,显著优于基线模型(19.8 ± 18.0),证明了其强大的零样本泛化能力。
- 该模型成功泛化至训练过程中未见过的新说话人和语言,同时保持了高水平的感知质量和风格保真度。
- VAE 所支持的潜在空间操作使得风格嵌入能够实现平滑的插值与混合,从而在动画中实现动态的风格过渡。
- 尽管性能表现强劲,该模型在语音适配性方面仍低于真实动作(TSG 数据集上为 36.7 ± 18.4 vs. 32.7 ± 21.0),表明在语义动作对齐方面仍有改进空间。
- 该模型偶尔会过度平滑特定风格的细微动作(例如“同意”风格中的点头动作),表明其在捕捉局部、低频动作方面存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。