[논문 리뷰] Pose-Controllable Talking Face Generation by Implicitly Modularized Audio-Visual Representation
논문은 PC-AVS를 제시한다. 이는 포즈 제어가 가능한 음향 주도식 말하는 얼굴 생성 프레임워크로, 암시적 저차원 포즈 코드와 모듈화된 음향-시각 표현을 사용하여 구조적 중간 표현에 의존하지 않고 별도의 포즈 소스 비디오에서 포즈 제어를 가능하게 한다.
While accurate lip synchronization has been achieved for arbitrary-subject audio-driven talking face generation, the problem of how to efficiently drive the head pose remains. Previous methods rely on pre-estimated structural information such as landmarks and 3D parameters, aiming to generate personalized rhythmic movements. However, the inaccuracy of such estimated information under extreme conditions would lead to degradation problems. In this paper, we propose a clean yet effective framework to generate pose-controllable talking faces. We operate on raw face images, using only a single photo as an identity reference. The key is to modularize audio-visual representations by devising an implicit low-dimension pose code. Substantially, both speech content and head pose information lie in a joint non-identity embedding space. While speech content information can be defined by learning the intrinsic synchronization between audio-visual modalities, we identify that a pose code will be complementarily learned in a modulated convolution-based reconstruction framework. Extensive experiments show that our method generates accurately lip-synced talking faces whose poses are controllable by other videos. Moreover, our model has multiple advanced capabilities including extreme view robustness and talking face frontalization. Code, models, and demo videos are available at https://hangz-nju-cuhk.github.io/projects/PC-AVS.
연구 동기 및 목표
- 음성 기반 말하는 얼굴 생성에서 자유로운 머리 자세 제어의 동기를 제시한다.
- 저차원 포즈 코드를 학습함으로써 명시적 2D/3D 구조 중간체에의 의존성을 제거한다.
- 임의적이고 데이터 기반 프레임워크에서 신원, 발화 내용, 포즈를 분리한다.
- 별도 비디오 소스로부터 포즈 전송을 허용하면서도 강력한 입 모양 동기화를 달성한다.
제안 방법
- 타깃 데이터 증강을 통해 대상 프레임에서 포즈 관련 변Variations를 포착하기 위해 비-신원 특징 공간을 식별한다.
- 음향-시각 정보를 세 가지 공간으로 모듈화한다: 발화 내용, 머리 포즈, 신원.
- 시각 및 음향 특징 간의 대조 학습(InfoNCE)을 사용하여 음향-시각 동기화를 학습한다.
- 최소한의 3D 포즈 선지에서 도출된 암시적 12-D 포즈 코드 정의하고 비-신원 특징을 이 포즈 공간으로 매핑한다.
- 합성 가중치가 신원, 발화 내용, 포즈 특징의 연결된 잠재 코드에 의해 동적으로 확장되는 모듀레이션 컨볼루션 기반 생성기를 사용한다.
- 적대적 손실, 재구성(L1), 지각적(VGG), 및 교차 모드 대조 손실의 조합으로 모듈화 및 포즈 정렬을 강제한다.
- 생성 중 포즈를 추론할 때 신원 및 발화 내용 공간으로 입 모양을 구동하고 포즈 소스 비디오로 머리 포즈를 제어한다.
실험 결과
연구 질문
- RQ1포즈를 명시적 3D 포즈 추정이나 랜드마크 없이 말하는 얼굴 생성에서 제어할 수 있는가?
- RQ2저차원 임의 포즈 코드가 입 모양 동기화를 유지하면서 머리 움직임을 모듈레이션하는 데 충분한가?
- RQ3한 비디오 소스의 포즈를 다른 얼굴의 말하는 얼굴에 음성으로 구동하여 전달할 수 있는가?
- RQ4신원, 발화 내용, 포즈를 모듈화하는 것이 극단적 시야에서 입 모양 동기화 및 강건성을 향상시키는가?
주요 결과
- 이 방법은 포즈 소스 비디오에서 포즈 제어를 가능하게 하면서도 정확한 입 모양 동기화를 달성한다.
- LRW에서 PC-AVS는 입 모양 동기화 및 이미지 품질에서 기본 모델과 동등하거나 이를 능가하며; VoxCeleb2에서 강력한 입 모양 동기화 및 포즈 제어 성능을 보인다.
- 이 접근법은 극단적 시야에서도 강건한 특성을 보이며 포즈 코드를 0으로 설정하여 얼굴을 정면화할 수 있다.
- 대조적 음향-시각 동기화 손실 및 12-차 포즈 코드의 중요성을 보여주는 제거 연구가 포즈 제어의 성공에 기여한다.
- 사용자 연구에서 PC-AVS가 여러 기초 모델에 비해 머리 움직임의 자연스러움과 비디오 현실감이 더 높다고 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.