[논문 리뷰] Multimodal-driven Talking Face Generation via a Unified Diffusion-based Generator
이 논문은 다중모odal 기반의 대화형 얼굴 생성을 위한 통합된 확산 기반 생성자(Generator)를 제안하며, 이는 작업을 목표 지향적 텍스처 전이로 간주하고, CLIP 임bedding된 텍스트를 활용해 감정 제어를 수행하고, 정체성과 기하학적 구조를 유지하는 텍스처-기하학 인식 확산 모델(TGDM)을 도입한다. 이 방법은 안정적이고 GAN 기반의 학습 및 추론을 통해 대화형 얼굴 생성과 얼굴 스왑 모두에서 최신 기술 수준(SOTA)의 성능을 달성한다.
Multimodal-driven talking face generation refers to animating a portrait with the given pose, expression, and gaze transferred from the driving image and video, or estimated from the text and audio. However, existing methods ignore the potential of text modal, and their generators mainly follow the source-oriented feature rearrange paradigm coupled with unstable GAN frameworks. In this work, we first represent the emotion in the text prompt, which could inherit rich semantics from the CLIP, allowing flexible and generalized emotion control. We further reorganize these tasks as the target-oriented texture transfer and adopt the Diffusion Models. More specifically, given a textured face as the source and the rendered face projected from the desired 3DMM coefficients as the target, our proposed Texture-Geometry-aware Diffusion Model decomposes the complex transfer problem into multi-conditional denoising process, where a Texture Attention-based module accurately models the correspondences between appearance and geometry cues contained in source and target conditions, and incorporate extra implicit information for high-fidelity talking face generation. Additionally, TGDM can be gracefully tailored for face swapping. We derive a novel paradigm free of unstable seesaw-style optimization, resulting in simple, stable, and effective training and inference schemes. Extensive experiments demonstrate the superiority of our method.
연구 동기 및 목표
- 다중모달 대화형 얼굴 생성에서 GAN 기반 생성자의 불안정성과 낮은 일반화 성능을 해결한다.
- 원본 지향적 특징 재배열의 한계를 극복하기 위해 작업을 목표 지향적 텍스처 전이로 재정의한다.
- CLIP 임베딩을 활용해 텍스트 모odal을 효과적으로 통합함으로써, 영향력 있는 제로샷 감정 제어를 가능하게 한다.
- 이미지, 영상, 오디오, 텍스트 기반의 대화형 얼굴 생성을 하나의 안정적인 확산 기반 생성자로 통합한다.
- 시야 교환(Seesaw) 최적화 방식을 피하는 복원 기반 프레임워크를 통해 얼굴 스왑으로의 확장을 가능하게 한다.
제안 방법
- 텍스트 프롬프트를 CLIP 임bedding된 감정 임베딩으로 표현하여 제로샷 감정 제어를 위한 풍부한 의미적 정보를 유산한다.
- 대화형 얼굴 생성을 목표 지향적 텍스처 전이로 프레임워크화: 3DMM 계수로부터 렌더링된 목표 얼굴에 원본 얼굴의 텍스처를 전이한다.
- 원본 텍스처와 목표 기하학적 구조를 다중 조건부 노이즈 제거 방식으로 조건화하는 텍스처-기하학 인식 확산 모델(TGDM)을 설계한다.
- 정확한 텍스처 전이를 위해 원본 외관과 목표 기하학 간의 교차 어텐션을 모델링하기 위해 텍스처 어텐션 모듈을 통합한다.
- 3DMM 계수를 활용해 목표 얼굴를 3D 렌더링하여 조건부 기준으로 삼아 구조적 정밀도를 확보한다.
- 같은 TGDM 프레임워크를 얼굴 스왑에 적용하기 위해 원본 정체성 영역을 마스킹하고, 렌더링된 목표 얼굴를 조건으로 사용함으로써 안정적인 복원 기반 학습을 가능하게 한다.
실험 결과
연구 질문
- RQ1학습 재조정 없이도 텍스트 모달이 대화형 얼굴 생성에서 감정 제어에 효과적으로 활용될 수 있는가?
- RQ2다중모달 대화형 얼굴 생성에서 작업별 GAN 기반 아키텍처를 대체할 수 있는 통합된 확산 기반 생성자가 존재하는가?
- RQ3원본 지향적 특징 재배열 대비 목표 지향적 텍스처 전이 프레임워크가 정체성 유지와 잡음 감소에 더 우수한가?
- RQ4제안된 TGDM 프레임워크는 안정적이고 GAN 기반의 학습 및 추론을 통해 얼굴 스왑으로 확장될 수 있는가?
- RQ5CLIP 임bedding된 텍스트는 제로샷 감정 일반화를 어떻게 향상시키는가?
주요 결과
- 제안된 방법은 대화형 얼굴 생성과 얼굴 스왑 모두에서 SOTA 성능을 달성하였으며, FaceForensics++ 데이터셋에서 15.87 FID 스코어를 기록하여 이전 방법들을 능가한다.
- 정체성 유지와 속성 일致성 측면에서 경쟁자들보다 뚜렷하게 뛰어난 0.6121 ID-A(정체성 정확도)와 0.1122 각도 오차를 달성하였다.
- 절단 실험 결과, 입 부분만 제외한 소형 마스크를 사용할 경우 전체 또는 확장 마스크보다 더 높은 현실감을 보였으며 잡음이 감소하였다.
- 렌더링된 3D 얼굴를 조건으로 제거할 경우 원본 얼굴의 색조에 치우친 색상 편향이 발생함을 확인하여, 이 조건이 속성 유지에 핵심적인 역할을 한다는 것을 입증하였다.
- TGDM 프레임워크는 단순한 복원 손실만으로도 안정적인 학습을 가능하게 하여, GAN 기반 얼굴 스왑에서 흔히 발생하는 불안정한 시야 교환 최적화를 피할 수 있었다.
- CLIP 기반 텍스트 프롬프팅을 통해 재학습 없이도 새로운 감정에 잘 일반화되며, 제로샷 감정 제어가 가능함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.