Skip to main content
QUICK REVIEW

[論文レビュー] Learning Hierarchical Cross-Modal Association for Co-Speech Gesture Generation

Xian Liu, Qianyi Wu|arXiv (Cornell University)|Mar 24, 2022
Hand Gesture Recognition Systems被引用数 6
ひとこと要約

本稿では、音声、テキスト、人体の動きの間の階層的クロスモodalな関連性を学習する新しいフレームワークHA2Gを提案する。階層的音声学習者を用いて多スケールの音声特徴を抽出し、肩から指へと粗いものから細かいものへと段階的に姿勢を生成する階層的ポーズ推定器を用いることで、従来手法を上回る現実的で詳細なジェスチャーを生成する。

ABSTRACT

Generating speech-consistent body and gesture movements is a long-standing problem in virtual avatar creation. Previous studies often synthesize pose movement in a holistic manner, where poses of all joints are generated simultaneously. Such a straightforward pipeline fails to generate fine-grained co-speech gestures. One observation is that the hierarchical semantics in speech and the hierarchical structures of human gestures can be naturally described into multiple granularities and associated together. To fully utilize the rich connections between speech audio and human gestures, we propose a novel framework named Hierarchical Audio-to-Gesture (HA2G) for co-speech gesture generation. In HA2G, a Hierarchical Audio Learner extracts audio representations across semantic granularities. A Hierarchical Pose Inferer subsequently renders the entire human pose gradually in a hierarchical manner. To enhance the quality of synthesized gestures, we develop a contrastive learning strategy based on audio-text alignment for better audio representations. Extensive experiments and human evaluation demonstrate that the proposed method renders realistic co-speech gestures and outperforms previous methods in a clear margin. Project page: https://alvinliu0.github.io/projects/HA2G

研究の動機と目的

  • 共話ジェスチャー合成における包括的ポーズ生成の限界、特に指の動きのようなミクロスケールの運動を捉えられていない点を是正すること。
  • 音声の階層的意味と、複数スケールにわたる人間のジェスチャーの階層的構造をモデル化すること。
  • 判別的音声表現を得るために、対照的学習を活用して音声、テキスト、ポーズの間のクロスモーダルな整合性を向上させること。
  • 上半身の関節から始まり、指のような詳細な部分へと段階的に進む粗いものから細かいものへの順序で人体ポーズを生成すること。
  • 新しい物理的正則化戦略と階層的ポーズ生成を用いてジェスチャーのリアルさを向上させること。

提案手法

  • 深層音声バックボーンを用いて、音声とテキストの間の対照的学習により特徴の判別性を高める、多段階の音声表現を抽出する階層的音声学習者。
  • 各段階で時間的依存性をモデル化するための双方向GRUを用い、肩から指へと木構造的に段階的に姿勢を生成する階層的ポーズ推定器。
  • 多段階の音声特徴を特定の身体部位の階層にリンクさせることで、話者の外見と発話スタイルを条件としてクロスモーダルな関連性を確立する。
  • 運動学的妥当性を保証し、生成されたポーズのリアルさを向上させるために、新しい物理的正則化を適用する。
  • 再構成、対照的、正則化の項を組み合わせたマルチタスク損失を用いて、エンドツーエンドでモデルを訓練する。
  • 意味的レベルとリズミカルレベルの両方の音声キューをモデル化することで、多様なジェスチャー生成を可能にする。

実験結果

リサーチクエスチョン

  • RQ1音声とジェスチャーの間の階層的クロスモーダル関連性を効果的にモデル化することで、細分化されたジェスチャー生成をどのように改善できるか?
  • RQ2多スケールの音声表現は、音声と微細な人間のジェスチャーとの整合性をどのように向上させるか?
  • RQ3粗いものから細かいものへの階層的ポーズ生成戦略は、共話ジェスチャーのリアルさと時間的滑らかさをどのように向上させるか?
  • RQ4音声とテキストの間の対照的学習は、ジェスチャー合成のための音声埋め込みの判別性をどの程度向上させるか?
  • RQ5客観的指標と人間の知覚の両面で、提案手法は最先端の手法と比べてどの程度優れているか?

主な発見

  • HA2Gは、客観的評価指標と人間評価の両方で、従来の最先端手法を顕著に上回り、優れたジェスチャーのリアルさと同期性を示した。
  • 人間評価では、HA2Gが生成したジェスチャーが自然さ、滑らかさ、同期性の観点でベースラインモデルと比較して最高評価を得た。
  • モデルは指の動きや、指の柔軟性や上腕部の相対的に安定した部分を含む、さまざまな身体部位における動的パターンを効果的に捉えていた。
  • 音声とテキストの間の対照的学習により、音声表現の判別性が向上し、より良いクロスモーダルな整合性が達成された。
  • 階層的ポーズ生成戦略により、包括的生成アプローチに比べてよりリアルで時間的に整合性のある運動シーケンスが得られた。
  • 強力な性能を発揮しているが、訓練データが限られているため、「肩をすくめる」ような非常に微細なジェスチャーの処理にはまだ課題を抱えている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。