[논문 리뷰] QPGesture: Quantization-Based and Phase-Guided Motion Matching for Natural Speech-Driven Gesture Generation
이 논문은 자연스러운 음성 주도 3D 제스처 생성을 위한 양자화 기반 및 단계 유도 동작 매칭 프레임워크인 QPGesture를 제안한다. VQ-VAE를 사용해 제스처를 이산 단위로 압축하고, 음성 양자화에 대한 Levenshtein 거리 계산을 통해 음성-제스처 정렬을 실현함으로써 진동을 효과적으로 줄이고 이질성을 다루며, 단계 유도 기법이 자연스러움을 더욱 향상시켜 BEAT 데이터셋에서 최신 기술 수준의 성능을 달성하며 사용자 평가에서 뛰어난 인간다움과 적절성을 확보한다.
Speech-driven gesture generation is highly challenging due to the random jitters of human motion. In addition, there is an inherent asynchronous relationship between human speech and gestures. To tackle these challenges, we introduce a novel quantization-based and phase-guided motion-matching framework. Specifically, we first present a gesture VQ-VAE module to learn a codebook to summarize meaningful gesture units. With each code representing a unique gesture, random jittering problems are alleviated effectively. We then use Levenshtein distance to align diverse gestures with different speech. Levenshtein distance based on audio quantization as a similarity metric of corresponding speech of gestures helps match more appropriate gestures with speech, and solves the alignment problem of speech and gestures well. Moreover, we introduce phase to guide the optimal gesture matching based on the semantics of context or rhythm of audio. Phase guides when text-based or speech-based gestures should be performed to make the generated gestures more natural. Extensive experiments show that our method outperforms recent approaches on speech-driven gesture generation. Our code, database, pre-trained models, and demos are available at https://github.com/YoungSeng/QPGesture.
연구 동기 및 목표
- 비지도 VQ-VAE를 통해 이산적이고 의미 있는 제스처 단위를 학습하여 음성 주도 제스처 생성에서 발생하는 무작위 운동 진동을 해결하기 위해.
- 음성과 제스처 간 내재된 이질성을 해결하기 위해 음성 양자화에 대한 Levenshtein 거리를 사용하여 강건한 음성-제스처 정렬을 실현하기 위해.
- 운동 곡선에서 유도된 단계 값으로 최적의 제스처 후보를 선택하는 데 유도함으로써 제스처의 자연스러움을 향상시키기 위해.
- BEAT 벤치마크 데이터셋에서 정량적 지표와 사용자 평가 모두에서 최신 기술 수준의 성능을 달성하기 위해.
- 학습된 코드북 공간에서 이산 코드를 직접 조작함으로써 제스처 생성의 제어 가능성을 제공하기 위해.
제안 방법
- VQ-VAE 모듈을 사용해 고유하고 의미 있는 제스처 자세를 나타내는 이산 코드북을 학습함으로써 입력의 부여를 줄이고 무작위 진동을 완화한다.
- 음성을 동일한 코드북을 사용해 양자화하고, 음성 양자화 시퀀스 간의 Levenshtein 거리를 계산하여 높은 시간 정렬 정확도로 제스처를 음성에 매칭한다.
- 텍스트 임베딩을 음성과 함께 사용해 후보 제스처를 생성하고, 코사인 유사도를 통해 텍스트의 의미적 관련성을 음성 맥락과 측정한다.
- 운동 곡선에서 유도된 단계 값은 음성 기반 및 텍스트 기반 후보 간 최적의 제스처 선택을 유도하여 리듬적이고 의미적으로 일관된 결과를 확보한다.
- 최종 제스처 시퀀스는 음성 기반 및 텍스트 기반 후보의 단계 유도 융합 기반으로 코드북에서 최적의 매칭 코드를 선택함으로써 생성된다.
- 프레임워크는 코드북 내 이산 코드를 직접 조작함으로써 제어 가능한 제스처 생성을 지원하여 타겟된 제스처 편집 또는 합성을 가능하게 한다.
![Figure 1 : Gesture examples generated by our proposed method on various types of speech. The character is from Mixamo [ 2 ] .](https://ar5iv.labs.arxiv.org/html/2305.11094/assets/x1.png)
실험 결과
연구 질문
- RQ1학습된 이산 코드북이 의미 있는 제스처 단위를 효과적으로 표현하고 음성 주도 제스처 생성에서 운동 진동을 줄일 수 있는가?
- RQ2음성 양자화에 대한 Levenshtein 거리가 종래의 엔드 투 엔드 신경망 모델 대비 음성과 제스처 간 시간 정렬을 향상시킬 수 있는가?
- RQ3음성 기반 및 텍스트 기반 제스처 후보 간 단계 유도 선택이 생성된 제스처의 자연스러움과 의미적 적절성을 향상시키는가?
- RQ4정량적 품질과 제어 가능성 측면에서 제안된 동작 매칭 프레임워크는 엔드 투 엔드 생성 모델보다 어떻게 비교되는가?
- RQ5개별 구성 요소(음성 양자화, 단계 유도, 텍스트 매칭)가 사용자 평가 및 정량적 지표에서 전체 성능에 얼마나 기여하는가?
주요 결과
- 제안된 QPGesture 프레임워크는 BEAT 벤치마크에서 최신 기술 수준의 성능을 달성하여 최근의 신경망 기반 모델보다 정량적 지표와 사용자 평가 모두에서 뛰어난 성능을 보였다.
- 사용자 평가에서 인간다움과 상체 제스처의 적절성 향상이 뚜렷하게 나타났으며, 전체 모델은 지표와 유사한 높은 MOS 점수를 확보했다.
- 제거 실험 결과, 음성 양자화 또는 Levenshtein 거리 제거 시 성능 저하가 발생하여 이들이 정렬 및 품질 향상에 결정적인 역할을 함을 입증했다.
- 단계 유도가 제스처의 자연스러움을 향상시켰으며, 단계 유도 없이 비교한 결과 헬링거 거리와 FGD 점수가 감소함을 확인했지만, 효과는 미묘했다.
- 운동 매칭을 사용하지 않은 모델(즉, GRU 기반 생성기 사용)은 매칭 기반 접근보다 유의미하게 열등했으며, 원시 데이터 공간에서 FGD가 107% 증가했다.
- 프레임워크는 시퀀스 내 특정 코드를 교체함으로써 제스처 편집을 제어 가능하게 하여 제스처 조작 및 해석에 실용적인 유용성을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.