[논문 리뷰] DiffuseStyleGesture: Stylized Audio-Driven Co-Speech Gesture Generation with Diffusion Models
DiffuseStyleGesture는 WavLM 음성 특징을 활용한 교차국소 및 자기주의 메커니즘을 통해 음성에 기반한 공화동작 생성을 위한 확산 모델 기반 접근법을 제안한다. 이는 리듬과 의미를 모두 반영한 고품질, 음성에 부합하는 스타일화되고 다양한 동작을 생성한다. 분류자 없는 가이던스를 통해 스타일 보간 및 초기 동작 조작에 대한 세밀한 제어를 가능하게 하여 인간다움과 음성 적합성 측면에서 이전 방법들을 능가한다.
The art of communication beyond speech there are gestures. The automatic co-speech gesture generation draws much attention in computer animation. It is a challenging task due to the diversity of gestures and the difficulty of matching the rhythm and semantics of the gesture to the corresponding speech. To address these problems, we present DiffuseStyleGesture, a diffusion model based speech-driven gesture generation approach. It generates high-quality, speech-matched, stylized, and diverse co-speech gestures based on given speeches of arbitrary length. Specifically, we introduce cross-local attention and self-attention to the gesture diffusion pipeline to generate better speech matched and realistic gestures. We then train our model with classifier-free guidance to control the gesture style by interpolation or extrapolation. Additionally, we improve the diversity of generated gestures with different initial gestures and noise. Extensive experiments show that our method outperforms recent approaches on speech-driven gesture generation. Our code, pre-trained models, and demos are available at https://github.com/YoungSeng/DiffuseStyleGesture.
연구 동기 및 목표
- 음성의 리듬과 의미를 모두 반영한 다양하고 현실적이며 음성에 부합하는 공화동작 생성의 과제를 해결하기 위해.
- GAN, VAE, 플로우 기반 모델이 동작 생성에서 겪는 한계, 특히 모드 붕괴와 품질-다양성 트레이드오프 문제를 극복하기 위해.
- 분류자 없는 가이던스를 통해 스타일 보간 및 초깃세트 동작 제어를 가능하게 하여 제어 가능한 동작 생성을 실현하기 위해.
- 지역적 및 전역적 의존성을 포착하는 주의 메커니즘을 통해 음성과 동작 간의 시간적 정렬을 향상시키기 위해.
- WavLM 음성 특징에서 추출한 의미적 및 정서적 정보를 통합함으로써 강인성과 일반화 능력을 향상시키기 위해.
제안 방법
- 모델은 WavLM 특징을 통한 음성, 초깃세트 동작, 스타일 임베딩에 조건이 붙은 노이즈 제거 확산 과정을 활용하여 시간적으로 정렬된 동작을 생성한다.
- 교차국소 주의는 음성 및 동작 특징 간의 짧은 거리 상관관계를 포착하여 국소적 동기화를 향상시킨다.
- 자기주의는 장기적 시간 의존성을 모델링하여 임의의 길이의 음성에 적합한 동작 생성을 가능하게 한다.
- 분류자 없는 가이던스는 훈련 중 무작위 마스크를 사용하여 스타일 및 초깃세트 동작 조건의 보간 및 외삽을 허용한다.
- 모델은 노이즈를 예측하는 대신 직접 노이즈 제거된 동작 시퀀스를 예측함으로써 훈련 안정성과 생성 품질을 향상시킨다.
- 반복적인 노이즈 제거를 통해 데이터 분포를 학습함으로써 고해상도 동작 생성을 위해 아키텍처가 설계되었으며, 주의 메커니즘이 음성-동작 정렬을 향상시킨다.
실험 결과
연구 질문
- RQ1확산 모델은 임의의 길이의 음성 입력에 대해 다양하고 고품질이며 음성에 부합하는 공화동작을 효과적으로 생성할 수 있는가?
- RQ2교차국소 및 자기주의 메커니즘은 음성 및 동작 시퀀스 간의 시간적 정렬을 어떻게 향상시키는가?
- RQ3분류자 없는 가이던스를 통해 얼마나 높은 수준의 제어 가능한 스타일 편집 및 초깃세트 동작 조작이 가능한가?
- RQ4기존의 MFCC와 같은 전통적 음성 특징에 비해 WavLM 특징을 통합함으로써 동작 생성 품질과 강인성이 향상되는가?
- RQ5앞서 주의(Forward attention)는 성능을 떨어뜨리는 이유는 무엇이며, 이는 인간의 동작 생산 시간 역학에 대해 어떤 통찰을 제공하는가?
주요 결과
- 전체 DiffuseStyleGesture 모델은 인간다움 점수 4.11 ± 0.08과 음성 적합성 점수 4.11 ± 0.10을 기록하여 아웃라이어 모델보다 유의미하게 뛰어난 성능을 보였다.
- WavLM 특징을 제거하면 음성 적합성 점수가 3.91 ± 0.11로 떨어지며, 의미적 및 정서적 음성 정보가 정렬에 필수적임을 입증했다.
- 교차국소 주의를 제거하면 성능이 급격히 하락한다(인간다움: 3.76 ± 0.09, 적합성: 3.51 ± 0.15)로, 이는 국소적 음성-동작 동기화에 있어 그 중요성을 입증한다.
- 자기주의를 제거하면 성능이 가장 열 劣하다(인간다움: 3.55 ± 0.13, 적합성: 3.08 ± 0.10)로, 장기적 의존성 모델링에 있어 그 핵심적 역할을 확인한다.
- 주의를 GRU 기반 모델링으로 대체하면 점수가 가장 낮게 나온다(3.10 ± 0.11 및 2.98 ± 0.14)로, 이 작업에서 주의 메커니즘이 우월함을 확인한다.
- 앞서 주의는 교차국소 주의보다 성능이 열 劣하며, 이는 동작이 주로 현재 및 과거 음성에 의해 영향을 받고 미래 음성은 영향을 적게 받는다는 점을 시사하며, 인간의 운동 계획과 일치한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.