Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Hierarchical Cross-Modal Association for Co-Speech Gesture Generation

Xian Liu, Qianyi Wu|arXiv (Cornell University)|2022. 03. 24.
Hand Gesture Recognition Systems인용 수 6
한 줄 요약

이 논문은 말, 텍스트, 인간의 신체 운동 간의 계층적 다중모odal 연관성을 학습하는 새로운 프레임워크 HA2G를 제안한다. 다층적 음성 특징을 추출하기 위해 계층적 음성 학습기(Hierarchical Audio Learner)를 사용하고, 어깨에서 손가락까지 계층적으로 세분화된 방식으로 자세를 생성하기 위해 계층적 자세 추론기(Hierarchical Pose Inferer)를 활용함으로써, 이론적이고 세밀한 제스처를 생성하며, 기존 방법들보다 목적적 지표와 인간 평가 모두에서 뛰어난 성능을 보인다.

ABSTRACT

Generating speech-consistent body and gesture movements is a long-standing problem in virtual avatar creation. Previous studies often synthesize pose movement in a holistic manner, where poses of all joints are generated simultaneously. Such a straightforward pipeline fails to generate fine-grained co-speech gestures. One observation is that the hierarchical semantics in speech and the hierarchical structures of human gestures can be naturally described into multiple granularities and associated together. To fully utilize the rich connections between speech audio and human gestures, we propose a novel framework named Hierarchical Audio-to-Gesture (HA2G) for co-speech gesture generation. In HA2G, a Hierarchical Audio Learner extracts audio representations across semantic granularities. A Hierarchical Pose Inferer subsequently renders the entire human pose gradually in a hierarchical manner. To enhance the quality of synthesized gestures, we develop a contrastive learning strategy based on audio-text alignment for better audio representations. Extensive experiments and human evaluation demonstrate that the proposed method renders realistic co-speech gestures and outperforms previous methods in a clear margin. Project page: https://alvinliu0.github.io/projects/HA2G

연구 동기 및 목표

  • 공말 제스처 합성에서 전체 자세 생성의 한계를 해결하여 손가락 움직임과 같은 미세 척도 운동을 포착하지 못하는 문제를 해결한다.
  • 말의 계층적 의미와 인간 제스처의 다중 해상도 계층적 구조를 모델링한다.
  • 대비 학습을 활용하여 음성, 텍스트, 자세 간의 다중모달 정렬을 향상시킨다.
  • 어깨에서 손가락까지 상향식으로 세분화된 방식으로 자세를 생성함으로써, 상체 관절에서 시작하여 더 세밀한 세부 사항으로 진행한다.
  • 새로운 물리적 정규화 전략을 통해 제스처의 현실감을 향상시킨다.

제안 방법

  • 깊이 있는 음성 기반 모델을 사용해 다중 수준의 음성 표현을 추출하는 계층적 음성 학습기이며, 음성과 텍스트 간의 대비 학습을 통해 특징의 구분 능력을 향상시킨다.
  • 양방향 GRU를 사용해 각 수준에서 시간적 의존성을 모델링함으로써, 수직적 트리 구조를 갖는 계층적 자세 추론기가 어깨에서 손가락까지 계단식으로 자세를 생성한다.
  • 다중 수준의 음성 특징을 특정 신체 부위의 계층에 연결함으로써 다중모달 연관성을 수립하며, 화자 외형과 말하는 스타일에 따라 조건화된다.
  • 운동역학적 타당성과 생성된 자세의 현실감 향상을 위해 새로운 물리적 정규화 전략을 적용한다.
  • 재구성, 대비, 정규화 항목을 포함한 다중 과제 손실을 통해 엔드 투 엔드로 모델을 훈련시킨다.
  • 의미 수준과 리듬 수준의 음성 신호를 모두 모델링함으로써 다양한 제스처 생성을 지원한다.

실험 결과

연구 질문

  • RQ1말과 제스처 간의 계층적 다중모달 연관성을 효과적으로 모델링하여 세밀한 제스처 생성을 향상시킬 수 있는가?
  • RQ2다중 해상도 음성 표현은 말과 미세한 인간 제스처 간의 정렬을 향상시킬 수 있는가?
  • RQ3상향식으로 세분화된 계층적 자세 생성 전략은 공말 제스처의 현실감과 시간적 매끄러움을 향상시키는가?
  • RQ4음성과 텍스트 간의 대비 학습은 제스처 합성에 활용되는 음성 임베딩의 구분 능력을 얼마나 향상시키는가?
  • RQ5목적적 지표와 인간 인식 측면에서 제안된 방법은 최신 기술 대비 얼마나 뛰어난가?

주요 결과

  • HA2G는 목적적 평가 지표와 인간 평가 양 측면에서 이전 최고 수준의 방법들을 크게 앞서며, 뛰어난 제스처 현실감과 동기화 능력을 입증한다.
  • 인간 평가 결과, HA2G가 생성한 제스처는 자연스러움, 매끄러움, 동기화 측면에서 베이스라인 모델들보다 가장 높은 평가를 받았다.
  • 손가락 움직임과 다양한 신체 부위의 동적 패턴(탄력 있는 손가락, 비교적 안정된 상지 등)을 포함한 세밀한 제스처를 성공적으로 포착했다.
  • 음성과 텍스트 간의 대비 학습을 통해 음성 표현의 구분 능력이 향상되어 더 나은 다중모달 정렬이 이루어졌다.
  • 계층적 자세 생성 전략은 전체 자세 생성 방법보다 더 현실적이고 시간적으로 일관된 운동 시퀀스를 생성하는 데 기여했다.
  • 강력한 성능에도 불구하고, 희귀한 동작인 '어깨 떨림'과 같은 매우 미세한 제스처는 훈련 데이터가 제한되어 있어 여전히 어려움을 겪고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.