[논문 리뷰] Audio2Gestures: Generating Diverse Gestures from Speech Audio with Conditional Variational Autoencoders
이 논문은 음성 음향과 공화동작 간의 일대다 매핑을 모델링하기 위해 공유(음성 주도) 및 운동 특화(다양성 유도) 성분으로 잠재 코드를 분할하는 조건부 변동 자동차오더(conditional variational autoencoder)인 Audio2Gestures를 제안한다. 매핑 네트워크, 완화된 운동 손실, 다양성 정규화를 도입함으로써, 이전 방법보다 더 현실적이고 다양한 다중모odal 동작을 생성한다. 이는 운동 특화 잠재 코드 조작을 통한 제약 있는 운동 편집에 적용 가능하다.
Generating conversational gestures from speech audio is challenging due to the inherent one-to-many mapping between audio and body motions. Conventional CNNs/RNNs assume one-to-one mapping, and thus tend to predict the average of all possible target motions, resulting in plain/boring motions during inference. In order to overcome this problem, we propose a novel conditional variational autoencoder (VAE) that explicitly models one-to-many audio-to-motion mapping by splitting the cross-modal latent code into shared code and motion-specific code. The shared code mainly models the strong correlation between audio and motion (such as the synchronized audio and motion beats), while the motion-specific code captures diverse motion information independent of the audio. However, splitting the latent code into two parts poses training difficulties for the VAE model. A mapping network facilitating random sampling along with other techniques including relaxed motion loss, bicycle constraint, and diversity loss are designed to better train the VAE. Experiments on both 3D and 2D motion datasets verify that our method generates more realistic and diverse motions than state-of-the-art methods, quantitatively and qualitatively. Finally, we demonstrate that our method can be readily used to generate motion sequences with user-specified motion clips on the timeline. Code and more results are at https://jingli513.github.io/audio2gestures.
연구 동기 및 목표
- 기존 모델이 일대일 가정으로 인해 실패하는 음성 음향과 공화동작 간의 일대다 매핑 문제를 해결하기 위해.
- 다중모달 운동 출력을 명시적으로 모델링하여 음성 주도 동작 생성의 운동 현실성과 다양성을 향상시키기 위해.
- 사용자 제어 가능한 운동 합성을 위해 운동 특화 잠재 코드 편집을 허용하여 사전 정의된 동작 삽입을 가능하게 하기 위해.
- 새로운 훈련 전략(완화된 손실 및 다양성 정규화 포함)을 통해 분리된 VAE에서 발생하는 훈련 불안정성과 열화를 극복하기 위해.
제안 방법
- 같은 음성 입력에 대해 다양한 운동 출력을 모델링하기 위해, 다중모odal 잠재 코드를 음성으로부터 학습된 공유 코드와 음성과 독립적인 운동 특화 코드로 분할한다.
- 샘플된 운동 특화 노이즈의 통계적 분포를 진짜 운동 특화 특징 분포와 일치시키기 위해 매핑 네트워크를 도입하여 열화를 방지한다.
- 목표에서 큰 관절 이탈만을 벌금으로 부과하는 완화된 운동 손실을 적용하여, 운동 특화 코드가 운동을 조절하면서도 음성 제어를 유지할 수 있도록 한다.
- 모드 붕괴를 완화하고 생성된 시퀀스의 운동 다양성을 향상시키기 위해 자전거 일致성 손실과 다양성 손실을 사용한다.
- 운동 인코더는 기준 운동 클립에서 운동 특화 코드를 추출하여, 코드 교체를 통해 생성된 동작에 정밀한 제어를 가능하게 한다.
- 재구성, 공유 코드, 정규화 손실을 사용하여 3D 및 2D 운동 데이터셋에서 종단간 훈련을 수행한다.
![Figure 4: User study results comparing our method against the state-of-the-art methods. “S2G” is short for Speech2Gesture [ 12 ] . The horizontal axis represents the number of samples rated by the participants. In total, 160 comparisons have been rated (40 participants, 4 comparisons each questionna](https://ar5iv.labs.arxiv.org/html/2108.06720/assets/x1.png)
실험 결과
연구 질문
- RQ1공유 및 운동 특화 코드를 갖춘 분리된 잠재 공간이 음성 음향과 동작 간의 일대다 관계를 효과적으로 모델링할 수 있는가?
- RQ2VAE 프레임워크에 운동 특화 잠재 코드를 도입할 때 훈련 불안정성과 열화를 어떻게 완화할 수 있는가?
- RQ3모델은 기존 일대일 매핑 기반 모델보다 우수한 성능을 보이는 다양한, 현실적인, 다중모달 동작을 생성할 수 있는가?
- RQ4운동 특화 코드를 얼마나 효과적으로 사용하여 생성된 운동 시퀀스에 사전 정의된 동작을 편집하고 삽입할 수 있는가?
주요 결과
- 제안된 방법은 기준 모델의 3.44에서 3.68로 상승한 다중모달성 점수를 달성하여, 다양한 운동 출력을 더 잘 모델링하고 있음을 나타낸다.
- 모델은 평균 다양성을 5.86에서 6.31로 향상시키며, L1 손실 감소와 PCK 증가로 인해 높은 현실성 유지함을 확인했다.
- 모델는 L1 손실, PCK, 다양성, 다중모달성 등 모든 정량적 지표에서 기준 모델을 초월하여, 더 뛰어난 현실성과 다양성을 입증했다.
- 운동 특화 코드 교체를 통해 사용자 정의 운동 클립을 매끄럽고 현실적으로 삽입할 수 있어, 제약 있는 운동 편집에의 적용 가능성을 검증했다.
- 완화된 운동 손실과 다양성 정규화는 모드 붕괴를 효과적으로 줄였으며, 다양성 및 다중모달성 점수의 일관된 향상을 보였다.
- 샘플된 노이즈를 운동 특화 특징과 일치시키기 위해 매핑 네트워크가 필수적임을 입증했으며, 이 네트워크가 없으면 다중모달성은 향상되더라도 성능 저하가 발생한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.