[논문 리뷰] Listen, Denoise, Action! Audio-Driven Motion Synthesis with Diffusion Models
이 논문은 음성 기반 3D 인간 운동 생성을 위한 확산 모델 기반 프레임워크를 제안하며, 복잡한 운동 시퀀스를 모델링하기 위해 Conformer 아키텍처를 사용하고, 스타일 제어를 위해 분류기 자유 가이던스를 적용한다. 제안된 방법은 제스처 및 댄스 생성에서 최신 기술 수준의 운동 품질을 달성하며, 제어 가능한 스타일 표현과 새로운 전문가 조합의 곱셈 기반 프레임워크를 통해 보간 및 모델 조합이 가능하다.
Diffusion models have experienced a surge of interest as highly expressive yet efficiently trainable probabilistic models. We show that these models are an excellent fit for synthesising human motion that co-occurs with audio, e.g., dancing and co-speech gesticulation, since motion is complex and highly ambiguous given audio, calling for a probabilistic description. Specifically, we adapt the DiffWave architecture to model 3D pose sequences, putting Conformers in place of dilated convolutions for improved modelling power. We also demonstrate control over motion style, using classifier-free guidance to adjust the strength of the stylistic expression. Experiments on gesture and dance generation confirm that the proposed method achieves top-of-the-line motion quality, with distinctive styles whose expression can be made more or less pronounced. We also synthesise path-driven locomotion using the same model architecture. Finally, we generalise the guidance procedure to obtain product-of-expert ensembles of diffusion models and demonstrate how these may be used for, e.g., style interpolation, a contribution we believe is of independent interest. See https://www.speech.kth.se/research/listen-denoise-action/ for video examples, data, and code.
연구 동기 및 목표
- 춤과 공음성 제스처와 같이 운동이 매우 모호하고 개인적인 특성을 지닌 맥락에서 음성에서 유도된 고품질, 다양한, 스타일적으로 표현력 있는 3D 인간 운동을 생성하는 데 도전하는 것.
- 음성 기반 운동의 복잡하고 비결정론적인 성격을 포괄할 수 있는 확률적 생성 모델을 개발하여, 결정론적 또는 비확률적 접근의 한계를 극복하는 것.
- 분류기 자유 가이던스를 통해 스타일 표현 강도를 조절할 수 있도록 제어 가능한 운동 생성을 가능하게 하는 것.
- 가이던스 메커니즘을 일반화하여, 스타일 보간 및 다양한 운동 스타일의 융합과 같은 새로운 작업을 위한 확산 모델의 전문가 조합의 곱셈 기반 프레임워크를 제공하는 것.
- 미래 연구를 위해 다양한 댄스 장르의 동기화된 음성과 3D 운동 캡처 데이터를 포함한 새로운 고품질 데이터셋을 공개하는 것.
제안 방법
- 확산 모델의 기존 DiffWave 아키텍처를 3D 인간 자세 시퀀스에 적응시키며, 확장된 컨볼루션 대신 Conformer를 사용하여 운동 데이터의 장거리 시간적 의존성을 향상시킨다.
- 소음으로 오염된 운동 시퀀스를 반복적으로 개선하기 위해, 음성 임베딩을 Conformer 기반 음성 인코더로 추출한 조건부로 동작하는 디노이징 U-Net 백본을 사용한다.
- 샘플링 중에 분류기 자유 가이던스를 적용하여, 클래스 레이블이 있는지 여부에 따라 출력을 비교함으로써 스타일 표현 강도를 제어한다.
- 다양한 확산 모델의 점수 함수를 가중 기하 평균으로 조합하여 전문가 조합의 곱셈 기반 프레임워크를 도입함으로써, 다양한 운동 스타일 간의 보간 및 융합이 가능하도록 한다.
- 다양한 노이즈 수준에서 운동 시퀀스의 정확한 재구성을 장려하는 다중 척도 학습 목표를 적용하여, 샘플 품질 향상과 학습 안정성 향상을 도모한다.
- 모든 모델에 공통된 음성 인코더를 활용하여, 다양한 전문가 구성 간에도 일관된 음성-운동 정렬을 보장한다.
실험 결과
연구 질문
- RQ1확산 모델은 춤과 공음성 제스처와 같이 고차원적이고 모호하며 개인적인 특성을 지닌 음성 기반 인간 운동의 특성을 효과적으로 모델링할 수 있는가?
- RQ2확산 기반 운동 생성에서 표준 컨볼루션 아키텍처에 비해 Conformer 기반 아키텍처가 운동 모델링 성능을 향상시킬 수 있는가?
- RQ3분류기 자유 가이던스는 음성 기반 운동 생성에서 스타일 표현 강도를 효과적으로 제어하는 데에 활용될 수 있는가?
- RQ4확산 모델의 전문가 조합의 곱셈 기반 프레임워크는 스타일 간 부드러운 보간 및 다양한 운동 스타일 융합과 같은 새로운 기능을 가능하게 하는가?
- RQ5제안된 방법은 경로 기반 이동에 일반화되어 있어, 제스처 및 댄스를 초월한 더 넓은 적용 가능성을 보여주는가?
주요 결과
- 제안된 방법은 여러 제스처 및 댄스 데이터셋에서 운동 품질 측면에서 최신 기술 수준의 성능을 달성하며, 정량적 지표와 정성적 평가 모두에서 주요 베이스라인 모델을 능가한다.
- 분류기 자유 가이던스를 통해 스타일 표현 강도를 효과적이고 제어 가능한 방식으로 조정할 수 있어, 사용자가 원하는 출력 특성에 맞게 더 표현력 있거나 덜 표현적인 운동을 생성할 수 있다.
- 전문가 조합의 곱셈 기반 프레임워크는 운동 스타일 간의 새로운 보간을 성공적으로 구현하여, 일관성 있고 청각적으로 타당한 중간 운동을 생성한다.
- 이 방법은 경로 기반 이동에 잘 일반화되어 있어, 댄스 및 제스처 생성을 초월한 강건성과 적응 가능성의 잠재력을 보여준다.
- 다양한 댄스 장르에서의 고품질 3D 운동과 음성 쌍 데이터셋을 새롭게 공개하여 향후 연구를 위한 유의미한 기준을 제공한다.
- 이 프레임워크는 효율적인 추론을 지원하며, 음성과 텍스트를 동시에 조건으로 삼아 의미적 제스처 생성과 같은 다중 모odal 생성으로도 확장 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.