Skip to main content
QUICK REVIEW

[论文解读] Learning Hierarchical Cross-Modal Association for Co-Speech Gesture Generation

Xian Liu, Qianyi Wu|arXiv (Cornell University)|Mar 24, 2022
Hand Gesture Recognition Systems被引用 6
一句话总结

该论文提出 HA2G,一种新颖的共话语手势生成框架,通过学习语音音频、文本与人体动作之间的分层跨模态关联,实现高阶的多粒度特征对齐。通过使用分层音频学习器提取多粒度音频特征,并利用分层姿态推理器从肩部到手指逐步生成姿态,该方法生成了逼真且精细的肢体动作,在客观指标与人类评估中均优于先前方法。

ABSTRACT

Generating speech-consistent body and gesture movements is a long-standing problem in virtual avatar creation. Previous studies often synthesize pose movement in a holistic manner, where poses of all joints are generated simultaneously. Such a straightforward pipeline fails to generate fine-grained co-speech gestures. One observation is that the hierarchical semantics in speech and the hierarchical structures of human gestures can be naturally described into multiple granularities and associated together. To fully utilize the rich connections between speech audio and human gestures, we propose a novel framework named Hierarchical Audio-to-Gesture (HA2G) for co-speech gesture generation. In HA2G, a Hierarchical Audio Learner extracts audio representations across semantic granularities. A Hierarchical Pose Inferer subsequently renders the entire human pose gradually in a hierarchical manner. To enhance the quality of synthesized gestures, we develop a contrastive learning strategy based on audio-text alignment for better audio representations. Extensive experiments and human evaluation demonstrate that the proposed method renders realistic co-speech gestures and outperforms previous methods in a clear margin. Project page: https://alvinliu0.github.io/projects/HA2G

研究动机与目标

  • 为解决共话语手势生成中整体姿态生成的局限性,该方法旨在捕捉如手指动作等微观尺度运动。
  • 建模语音中的分层语义与人体手势在多粒度层级上的结构特性。
  • 通过对比学习提升音频表征的判别性,从而改善音频、文本与姿态之间的跨模态对齐。
  • 以粗到细、级联的方式生成人体姿态,从上半身关节开始,逐步细化至手指等细节。
  • 通过一种新颖的物理正则化策略提升手势的真实感,并结合分层姿态生成机制。

提出的方法

  • 分层音频学习器利用深层音频主干网络提取多层级音频表征,并通过音频与文本之间的对比学习提升特征的判别能力。
  • 分层姿态推理器采用双向 GRU 模型,在每一层级上建模时间依赖性,以树状结构级联方式从肩部到手指生成姿态。
  • 通过将多层级音频特征与特定身体部位的层级结构关联,建立跨模态关联,同时受说话者外貌与表达风格的条件约束。
  • 引入一种新颖的物理正则化策略,以确保运动学上的合理性,提升生成姿态的真实感。
  • 采用端到端训练方式,损失函数结合重建损失、对比损失与正则化项,实现多任务联合优化。
  • 通过建模语义级与节奏级音频线索,支持多样化手势生成。

实验结果

研究问题

  • RQ1如何有效建模语音与手势之间的分层跨模态关联,以提升精细手势生成质量?
  • RQ2多粒度音频表征是否能增强语音与细微人体动作之间的对齐?
  • RQ3采用从粗到细的分层姿态生成策略是否能提升共话语手势的真实感与时间平滑性?
  • RQ4音频与文本之间的对比学习在多大程度上提升了音频嵌入的判别性,从而改善手势生成?
  • RQ5在客观指标与人类感知方面,该方法与最先进方法相比表现如何?

主要发现

  • HA2G 在客观评估指标与人类评估中均显著优于先前最先进方法,展现出更优的手势真实感与同步性。
  • 人类评估显示,HA2G 生成的手势在自然度、平滑性与同步性方面评分最高,优于基线模型。
  • 该模型成功捕捉了精细手势,如手指动作,以及不同身体部位的动态模式,包括灵活的手指与相对稳定的上臂。
  • 音频与文本之间的对比学习显著提升了音频表征的判别性,从而改善了跨模态对齐效果。
  • 分层姿态生成策略相比整体生成方法,能生成更真实且时间上连贯的动作序列。
  • 尽管性能优异,该模型在处理如“耸肩”等极细微动作时仍存在困难,主要因训练数据中此类罕见动作不足。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。