[논문 리뷰] TalkCLIP: Talking Head Generation with Text-Guided Expressive Speaking Styles
TalkCLIP는 참조 영상 대신 자연어 기술을 사용하여 표현적인 얼굴 애니메이션을 제어하는 텍스트 유도형, 원샷 토킹 헤드 생성 방법을 제안한다. CLIP 기반 스타일 인코더를 활용해 텍스트를 말하는 스타일 임베딩으로 매핑함으로써, 새로운 텍스트 기술에 대해 강한 일반화 능력을 보이며, 음성 및 텍스트 모두에서 스타일 일관성 면에서 기존 방법을 능가하는 사진처럼 사실적인 표현적인 토킹 헤드를 생성한다.
Audio-driven talking head generation has drawn growing attention. To produce talking head videos with desired facial expressions, previous methods rely on extra reference videos to provide expression information, which may be difficult to find and hence limits their usage. In this work, we propose TalkCLIP, a framework that can generate talking heads where the expressions are specified by natural language, hence allowing for specifying expressions more conveniently. To model the mapping from text to expressions, we first construct a text-video paired talking head dataset where each video has diverse text descriptions that depict both coarse-grained emotions and fine-grained facial movements. Leveraging the proposed dataset, we introduce a CLIP-based style encoder that projects natural language-based descriptions to the representations of expressions. TalkCLIP can even infer expressions for descriptions unseen during training. TalkCLIP can also use text to modulate expression intensity and edit expressions. Extensive experiments demonstrate that TalkCLIP achieves the advanced capability of generating photo-realistic talking heads with vivid facial expressions guided by text descriptions.
연구 동기 및 목표
- 음성 기반 토킹 헤드 생성에서 원하는 말하는 스타일을 가진 참조 영상 확보의 어려움을 해결하기 위해.
- 참조 영상 대신 자연어 기술로 제어되는 표현적인 토킹 헤드 생성을 가능하게 하기 위해.
- 학습을 위해 텍스트-비디오 쌍 데이터셋을 구성하고, 굵은 감정과 세밀한 얼굴 운동 단위(AU) 주석을 추가하기 위해.
- 도메인 외 텍스트 기술에 일반화할 수 있는 CLIP 기반 텍스트-말 스타일 인코더를 개발하기 위해.
- 음성 기반으로 고해상도의 사진처럼 사실적인 토킹 헤드 영상을 생성하고, 텍스트로 유도된 일관된 얼굴 표정을 유지하기 위해.
제안 방법
- MEAD 데이터셋에 프롬프트 기반 텍스트 기술을 두 수준으로 주석 처리: 굵은 감정 레이블과 AU 기반 세밀한 얼굴 운동 기술.
- 자연어 기술을 잠재 말 스타일 코드로 매핑하는 CLIP 기반 텍스트-말 스타일(T2SS) 인코더 설계.
- CLIP 텍스트 임베딩을 말 스타일 공간으로 매핑하기 위한 경량 어댑터 네트워크 도입하여 정적 텍스트 임베딩과 동적 얼굴 운동 간 격차를 메우기.
- 참조 영상에서 스타일 표현을 추출하기 위해 비디오-말 스타일(V2SS) 인코더 도입하고, T2SS와 V2SS 출력 간의 대비 학습을 가능하게 하기.
- 동일한 영상에 대해 T2SS 인코더의 잠재 스타일 코드와 V2SS 인코더의 코드 간 거리 최소화를 통해 T2SS 인코더를 훈련.
- 학습된 스타일 코드를 음성 기반 얼굴 애니메이션 디코더와 이미지 렌더러에 통합하여 사진처럼 사실적인 토킹 헤드 영상 생성.
실험 결과
연구 질문
- RQ1일반화된 참조 영상 없이 자연어 기술이 원샷 토킹 헤드 생성에서 표현적인 말 스타일을 효과적으로 제어할 수 있는가?
- RQ2학습 중에 볼 수 없었던 도메인 외(OOD) 텍스트 기술에 대해 CLIP 기반 텍스트 인코더가 얼마나 잘 일반화되는가?
- RQ3비디오 기반 참조 스타일 제어 대비 텍스트 기반 스타일 제어가 입술 동기화와 얼굴 표정 일관성 면에서 얼마나 뛰어난 성능을 보이는가?
- RQ4감정 + AU 기반 프롬프트 기반 텍스트 주석이 얼굴 운동 패턴과 의미적 대응을 얼마나 잘 포착하는가?
- RQ5추상어, 관용어, 또는 음성-감정 불일치와 같은 상황에서 텍스트 기반 스타일 제어의 한계는 무엇인가?
주요 결과
- TalkCLIP는 비교된 모든 방법 중에서 가장 높은 입술 동기화 점수를 기록하여 강력한 음성-시각 일치를 나타낸다.
- 동일한 이미지 렌더러를 사용한 최첨단 방법과 비교해도 경쟁력 있는 영상 현실성 점수를 확보한다.
- 비디오 기반 기준(예: EAMM, GC-AVT)을 능가하고, 가장 성능이 뛰어난 방법(StyleTalk)과 동일한 수준의 참조 영상 기반 스타일 일관성 성능을 기록한다.
- 모든 기준 대비 텍스트 기반 스타일 일관성 면에서 뚜렷이 뛰어나, 효과적인 텍스트-스타일 매핑을 입증한다.
- 사용자 연구 결과, 감정 기술에 대해 77%, 얼굴 운동 기술에 대해 73%의 텍스트 기술이 정확하게 평가되어 TA-MEAD 데이터셋의 품질을 검증한다.
- 메타포나 관용어처럼 매우 비유적인 언어에서는 성능이 저하되지만, 일반적인 추상어나 관용어에 대해서는 일반화가 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.