[논문 리뷰] Live Speech Portraits: Real-Time Photorealistic Talking-Head Animation
라이브 스피치 포트레이트(Live Speech Portraits, LSP)는 30 fps 이상에서 실시간으로 작동하는, 음성에 의해 구동되는 개인화된 포착형 초현실적인 대화형 헤드 애니메이션을 생성하는 최초의 시스템이다. 이 시스템은 만곡선 투영을 통해 야생 음성(야생의 음성)을 대상 화자에 맞는 말의 공간으로 적응시키는 딥 오디오 특징 추출 기술을 사용하고, 개인화된 머리 자세 생성을 위한 자동회귀 확률 모델을 적용하며, 조건부 특징 맵을 활용한 이미지 간 번역 네트워크를 통해 실시간으로 고해상도의 얼굴 세부 사항과 운동을 합성한다.
To the best of our knowledge, we first present a live system that generates personalized photorealistic talking-head animation only driven by audio signals at over 30 fps. Our system contains three stages. The first stage is a deep neural network that extracts deep audio features along with a manifold projection to project the features to the target person's speech space. In the second stage, we learn facial dynamics and motions from the projected audio features. The predicted motions include head poses and upper body motions, where the former is generated by an autoregressive probabilistic model which models the head pose distribution of the target person. Upper body motions are deduced from head poses. In the final stage, we generate conditional feature maps from previous predictions and send them with a candidate image set to an image-to-image translation network to synthesize photorealistic renderings. Our method generalizes well to wild audio and successfully synthesizes high-fidelity personalized facial details, e.g., wrinkles, teeth. Our method also allows explicit control of head poses. Extensive qualitative and quantitative evaluations, along with user studies, demonstrate the superiority of our method over state-of-the-art techniques.
연구 동기 및 목표
- 오직 음성으로만 구동되는 실시간, 개인화되고 초현실적인 대화형 헤드 애니메이션 시스템을 개발하는 것.
- 야생적이고 통제되지 않은 음성을 표현력 있고 화자 특유의 얼굴 운동과 동작으로 매핑하는 문제를 해결하는 것.
- 오직 음성으로부터 제어 가능하고 시간적으로 일관된 머리 및 상체 운동 생성을 가능하게 하는 것.
- 주름, 이가 포함된 개인의 특징을 유지하는 고해상도의 현실적인 얼굴 렌더링을 합성하는 것.
- 시각적 품질이나 개인화를 희생시키지 않고도 실시간 성능(30+ fps)을 달성하는 것.
제안 방법
- 자기지도 학습 오디오 특징 추출기가 원시 음성에서 화자에 종속되지 않는 표현을 생성한다.
- 대상 화자 전용 기준 특징을 사용하여 만곡선 투영 계층이 야생 음성 특징을 대상 화자의 말 공간으로 매핑한다.
- 현재 오디오와 이전 자세를 모두 조건으로 삼아 머리 자세 분포를 예측하는 자동회귀 확률 모델이 개인화되고 일관된 운동을 가능하게 한다.
- 예측된 머리 자세에서 상체 운동을 유도하여 시간적 일관성을 유지한다.
- 얼굴 키포인트 및 자세 예측에서 유도된 조건부 특징 맵이 이미지 간 번역 네트워크에 입력된다.
- 후보 이미지 세트와 예측된 운동 특징을 사용하여 이미지 번역 네트워크가 초현실적인 프레임을 합성함으로써 고해상도 렌더링을 가능하게 한다.
실험 결과
연구 질문
- RQ1실시간 시스템이 임의의 야생 음성 입력으로부터 개인화되고 초현실적인 대화형 헤드 애니메이션을 생성할 수 있는가?
- RQ2어떻게 오디오 특징을 조정하여 얼굴 질감과 운동 스타일과 같은 개인의 특수한 말 습관을 유지할 수 있는가?
- RQ3머리 자세의 자동회귀 모델링이 음성 구동 애니메이션에서 시간적 일관성과 개인화를 향상시킬 수 있는가?
- RQ4신경 렌더링이 실시간 제약 조건 하에서 주름, 이와 같은 현실적인 얼굴 세부 사항을 어느 정도 잘 생성할 수 있는가?
- RQ5정성적 및 정량적 평가에서 최신 기술 대비 시스템의 성능은 어떠한가?
주요 결과
- 시스템은 30 fps 이상의 실시간 성능을 달성하여 비디오 회의나 가상 아바타와 같은 상호작용형 응용 분야를 가능하게 한다.
- 만곡선 투영 모듈이 야생 음성을 대상 화자의 말 공간으로 성공적으로 적응시켜 주름, 이와 같은 개인의 얼굴 특징를 유지한다.
- 자동회귀 머리 자세 모델이 운동의 일관성과 개인화를 향상시켜 신경 렌더링의 성능 저하를 줄인다.
- 사용자 연구 결과, LSP는 현실감, 입술 동기화 정확도, 표현력 면에서 최신 기술 대비 선호됨을 확인하였다.
- 정량적 평가에서 기존 방법 대비 FID, LPIPS, 오디오-비디오 동기화 지표에서 뛰어난 성능을 보였다.
- 시스템은 예측되지 않은 음성, 특히 /p/, /b/, /m/과 같은 어려운 자음에 대해 잘 일반화되지만, 30 fps에서 짧은 음파는 놓칠 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.