[논문 리뷰] Speech2Video Synthesis with 3D Skeleton Regularization and Expressive Body Poses
이 논문은 3D 스켈레톤 정규화와 개인화된 제스처 사전을 활용하여 음성 오디오에서 사진 수준의 해상도를 갖는 표현력 있는 전신 영상을 생성하는 이단계적 음성-영상 합성 프레임워크를 제안한다. 음성에서 3D 신체 자세를 예측하기 위해 RNN을 사용하고, 표현력을 높이기 위해 핵심 자세를 삽입하며, 부분 인식 GAN과 주의 메커니즘을 활용하여 고해상도이자 왜곡 없는 영상, 특히 세밀한 얼굴과 손 렌더링을 생성한다.
In this paper, we propose a novel approach to convert given speech audio to a photo-realistic speaking video of a specific person, where the output video has synchronized, realistic, and expressive rich body dynamics. We achieve this by first generating 3D skeleton movements from the audio sequence using a recurrent neural network (RNN), and then synthesizing the output video via a conditional generative adversarial network (GAN). To make the skeleton movement realistic and expressive, we embed the knowledge of an articulated 3D human skeleton and a learned dictionary of personal speech iconic gestures into the generation process in both learning and testing pipelines. The former prevents the generation of unreasonable body distortion, while the later helps our model quickly learn meaningful body movement through a few recorded videos. To produce photo-realistic and high-resolution video with motion details, we propose to insert part attention mechanisms in the conditional GAN, where each detailed part, e.g. head and hand, is automatically zoomed in to have their own discriminators. To validate our approach, we collect a dataset with 20 high-quality videos from 1 male and 1 female model reading various documents under different topics. Compared with previous SoTA pipelines handling similar tasks, our approach achieves better results by a user study.
연구 동기 및 목표
- 기존 음성-영상 합성 방법에서의 표현력 부족 및 신체 운동의 물리적 타당성 부족 문제를 해결하기 위해.
- 제한된 영상 기록에서 개인화된 제스처를 학습할 때의 데이터 희소성과 다양성 문제를 해결하기 위해.
- 특히 손과 얼굴 영역에서 기하학적 왜곡을 줄이고 시각적 해상도를 향상시키기 위해.
- 운동 시퀀스에 핵심 자세를 삽입하여 표현력 있는 제스처를 제어 가능하게 하기 위해.
제안 방법
- 이중 단계 파이프라인을 사용한다: 먼저 RNN이 음성 오디오에서 3D 스켈레톤 시퀀스를 생성하여 인간 운동역학 제약 조건을 통해 물리적 타당성을 확보한다.
- 실제 음성 영상에서 유래한 개인화된 핵심 자세 사전을 구성하여 합성 중에 맥락적으로 적절한 제스처를 삽입할 수 있도록 한다.
- 부분 인식 판별자와 공간 주의 메커니즘을 적용하여 얼굴, 손, 머리 등 중요한 영역의 세부 정보를 향상시키기 위해 조건부 GAN을 설계한다.
- 해부학적으로 타당하지 않은 자세를 방지하고 운동의 현실감을 향상시키기 위해 3D 스켈레톤 관절을 중간 지도로 사용한다.
- 학습 데이터 분포와 일치시키기 위해 TTS 생성 오디오에 배경 잡음을 추가하여 입술 모양 왜곡을 방지한다.
- 학습된 보간 메커니즘을 사용해 핵심 자세를 스켈레톤 시퀀스에 삽입하여 표현력을 향상시킨다.
실험 결과
연구 질문
- RQ13D 스켈레톤 정규화는 음성-영상 합성에서 음성 구동 전신 운동의 물리적 타당성과 현실감을 향상시키는 데 효과적인가?
- RQ2제한된 학습 데이터에서 학습된 개인화된 제스처 사전은 운동의 표현력을 향상시키는 데 얼마나 효과적인가?
- RQ3부분 인식 GAN은 고해상도 영상 생성에서 시각적 해상도를 향상시키고 블러를 줄이는 데 상당한 기여를 하는가?
- RQ4운동 시퀀스에 핵심 자세를 삽입하는 것이 더 표현력 있고 인지적으로 자연스러운 영상 출력을 이끌어내는가?
주요 결과
- 제안된 방법은 총 시각 품질 평가에서 5점 만점에 3.42점을 기록하여 실제 영상 기준(4.38점)과 유사한 수준의 강한 인지적 현실감을 입증했다.
- 실제 음성 오디오에서 생성한 영상가 TTS 오디오에서 생성한 영상보다 모든 지표에서 뛰어났으며, 자연스럽지 않은 오디오와 배경 잡음 부족으로 인해 품질이著しく 떨어졌다.
- 제거 실험 결과, 80.6%의 참가자가 핵심 자세를 삽입한 영상보다 삽입하지 않은 영상보다 선호했으며, 이는 핵심 자세의 표현력 향상 효과를 확인한다.
- 스켈레톤에서 손 모델을 제거하면 지속적인 블러와 손 세부 정보 렌더링 불가로 이어져 명시적 손 모델링의 필요성을 입증한다.
- TTS 오디오에 흰 잡음을 추가하면 입술 모양의 현실감이 향상되어 학습 데이터 통계와 일치하는 것이 중요함을 보여준다.
- 부분 인식 GAN은 표준 GAN에 비해 얼굴과 손 영역의 세부 정보를 크게 향상시켜 블러와 기하학적 왜곡을 감소시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.