Skip to main content
QUICK REVIEW

[논문 리뷰] Freeform Body Motion Generation from Speech

Jing Xu, Wei Zhang|arXiv (Cornell University)|2022. 03. 04.
Human Motion and Animation인용 수 8
한 줄 요약

이 논문은 공음성 신체 운동을 확률적 자세 모드와 발화 조건부 리듬적 동작으로 분리하는 두 개의 스트림으로 구성된 확산 모델인 FreeMo를 제안한다. 이는 다양한 고품질의 음성 동기화 자유형 운동 생성을 가능하게 한다. 특히 다중 화자 데이터로 훈련된 경우, 기준 모델들보다 운동의 다양성, 품질, 동기화 성능에서 뛰어나다.

ABSTRACT

People naturally conduct spontaneous body motions to enhance their speeches while giving talks. Body motion generation from speech is inherently difficult due to the non-deterministic mapping from speech to body motions. Most existing works map speech to motion in a deterministic way by conditioning on certain styles, leading to sub-optimal results. Motivated by studies in linguistics, we decompose the co-speech motion into two complementary parts: pose modes and rhythmic dynamics. Accordingly, we introduce a novel freeform motion generation model (FreeMo) by equipping a two-stream architecture, i.e., a pose mode branch for primary posture generation, and a rhythmic motion branch for rhythmic dynamics synthesis. On one hand, diverse pose modes are generated by conditional sampling in a latent space, guided by speech semantics. On the other hand, rhythmic dynamics are synced with the speech prosody. Extensive experiments demonstrate the superior performance against several baselines, in terms of motion diversity, quality and syncing with speech. Code and pre-trained models will be publicly available through https://github.com/TheTempAccount/Co-Speech-Motion-Generation.

연구 동기 및 목표

  • 음성에서의 비결정적이고 자유형인 공음성 신체 운동의 특성을 다루며, 음성과의 일대일 매핑이 없는 문제를 해결한다.
  • 운동을 자세 모드(자세 상태)와 리듬적 동작(발화 조건부 동기화 운동)으로 분해하여, 확률성과 동기화를 별도로 모델링한다.
  • 화자 특화 스타일이나 고정된 제스처 템플릿에 의존하지 않고도 고다양도의 운동 생성을 가능하게 한다.
  • 다양한 화자 간 일반화를 향상시키기 위해 다중 화자 데이터로 훈련하면서도 강력한 음성 동기화 성능을 유지한다.

제안 방법

  • 음성 의미에 따라 조건부 샘플링을 수행하는 VAE 기반의 자세 모드 브랜치를 사용하여 잠재 공간에서 다양한 자세를 생성한다.
  • 음성 에너지와 톤 변화 곡선을 이용해 신속하고 발화 조건부로 손 동작을 추론하는 별도의 리듬적 운동 브랜치를 구현한다.
  • 운동 품질, 다양성, 음성 동기화를 모두 포함하는 다중 작업 손실을 사용하여 두 스트림 아키텍처를 종단 간(end-to-end)으로 훈련한다.
  • 다양한 화자 데이터를 활용하여 개인 간 공통의 운동 패턴을 학습함으로써 일반화 능력과 다양성을 향상시킨다.
  • 고정밀도 운동 샘플링과 제어 가능한 확률성을 위해 잠재 공간에서 확산 기반 생성 과정을 적용한다.
  • 신경 렌더러를 사용하여 생성된 2D 스켈레톤 시퀀스를 RGB 프레임으로 매핑함으로써 종단 간 영상 렌더링을 지원한다.

실험 결과

연구 질문

  • RQ1운동을 자세 모드와 리듬적 동작으로 분해함으로써 음성에서 신체 운동으로의 비결정적 매핑을 모델링할 수 있는가?
  • RQ2자세 생성과 리듬적 동작을 분리하면 운동의 다양성과 음성 동기화가 향상되는가?
  • RQ3화자 특화 조건 없이도 단일 모델이 여러 화자 간에 일반화 가능한가?
  • RQ4결정론적 기준 모델과 비교해 볼 때, 자유형이며 자연스러운 운동을 생성하는 데에 모델의 성능은 어떠한가?
  • RQ5다중 화자 훈련을 통해 운동 다양성이 얼마나 향상되고, 음성 동기화는 얼마나 유지되는가?

주요 결과

  • FreeMo는 다중 화자 데이터로 훈련된 경우, 화자 특화 및 템플릿 기반 기준 모델들보다 우수한 운동 다양성을 확보한다.
  • 한 번의 생성 과정에서 다양한 화자들로부터의 다양한 자세를 가진 운동 시퀀스를 생성함을 최근접 이웃 시각화를 통해 입증했다.
  • 리듬적 동작은 음성의 발화 조건과 효과적으로 동기화되어 있으며, 빠른 말일수록 더 빠른 운동을, 느린 말일수록 더 부드럽고 진정된 움직임을 생성한다.
  • 다양한 화자로 훈련된 모델는 음성 동기화 성능을 유지하며, 특히 동기화 지표에서 화자 특화 모델들을 능가한다.
  • 종단 간 영상 렌더링을 통해 아마추어 음성 입력에서도 현실적인 '전문가 수준'의 대화 영상을 생성할 수 있음을 입증했다.
  • 다양한 화자로 훈련할 경우 품질 점수가 略로 낮아지는 경향이 있으며, 이는 다양성과 정밀도 사이의 상충 관계를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.