[논문 리뷰] DiffSpeaker: Speech-Driven 3D Facial Animation with Diffusion Transformer
DiffSpeaker는 말하는 스타일과 확산 단계를 조건부로 삽입한 자기/교차 attention 메커니즘을 갖춘 확산 기반 Transformer 모델로, 말에 기반한 3D 얼굴 애니메이션을 위해 제안되었다. 이는 입술 동기화와 얼굴 표정 품질에서 최신 기술 수준의 성능을 달성하면서도 빠르고 병렬적인 추론을 가능하게 한다. 본 방법은 짧은 오디오-4D 시퀀스 데이터 부족 문제를 해결하기 위해 확산 단계와 말하는 스타일의 조건부 편향을 attention 메커니즘에 통합함으로써, 대규모 쌍화된 데이터가 필요 없이도 정렬과 다양성을 향상시킨다.
Speech-driven 3D facial animation is important for many multimedia applications. Recent work has shown promise in using either Diffusion models or Transformer architectures for this task. However, their mere aggregation does not lead to improved performance. We suspect this is due to a shortage of paired audio-4D data, which is crucial for the Transformer to effectively perform as a denoiser within the Diffusion framework. To tackle this issue, we present DiffSpeaker, a Transformer-based network equipped with novel biased conditional attention modules. These modules serve as substitutes for the traditional self/cross-attention in standard Transformers, incorporating thoughtfully designed biases that steer the attention mechanisms to concentrate on both the relevant task-specific and diffusion-related conditions. We also explore the trade-off between accurate lip synchronization and non-verbal facial expressions within the Diffusion paradigm. Experiments show our model not only achieves state-of-the-art performance on existing benchmarks, but also fast inference speed owing to its ability to generate facial motions in parallel.
연구 동기 및 목표
- 기존 방법의 한계를 극복하기 위해 확산 모델과 Transformer를 융합하여 말 기반 3D 얼굴 애니메이션의 성능을 향상시키는 것.
- 말 기반 애니메이션을 위한 확산 기반 Transformer 학습에서 짝지어진 오디오-4D 데이터가 부족한 문제를 해결하는 것.
- 조건부 확산 프레임워크 내에서 정확한 입술 동기화와 표현적인 비언어적 얼굴 운동 간의 균형을 이루는 것.
- 학습 중 데이터 집약도를 줄이고 장거리 컨텍스트를 유지하면서도 빠르고 병렬적인 추론을 가능하게 하기 위해 attention 메커니즘을 설계하는 것.
제안 방법
- 확산 단계와 말하는 스타일을 조건부 편향으로 삽입하여 관련된 시간적 및 의미적 신호에 주의를 집중시키는 새로운 조건부 자기/교차 attention 메커니즘을 도입한다.
- 오디오 입력에 의해 유도되는 조건부 확산 모델을 사용하며, 학습 중 10% 확률로 무조건적 노이즈 제거를 수행하여 출력의 다양성을 향상시킨다.
- 입술 동기화와 얼굴 표정의 풍부함 사이의 트레이드오프를 제어하기 위해 지침 스케일 $w$를 적용하지만, 최종 모델는 안정적이고 고정밀한 동기화를 확보하기 위해 이를 비활성화한다.
- 말과 얼굴 운동 간의 시간적 정렬을 우선시하기 위해 작업에 특화된 편향을 설계하여 학습 시 상당한 데이터 요구를 줄인다.
- 표준 자기/교차 attention을 조건 인식 편향으로 대체하여 관련된 오디오 및 운동 토큰에 주의를 집중시키며, 짧고 제한된 데이터에서도 효율성과 성능을 향상시킨다.
- 오디오와 운동 토큰 간의 교차 attention을 갖춘 노이즈 제거 U-Net 백본을 사용하며, 확산 단계와 말하는 스타일 정보를 코딩한 고정 편향으로 강화한다.
실험 결과
연구 질문
- RQ1제한된 쌍화된 오디오-4D 얼굴 운동 데이터에서 말 기반 애니메이션을 위한 확산 기반 Transformer를 효과적으로 학습할 수 있는가?
- RQ2자기/교차 attention에 특화된 조건 편향이 확산 기반 얼굴 애니메이션에서 시간적 정렬과 표정 품질 향상에 어떤 역할을 하는가?
- RQ3무조건적 지시가 입술 동기화 정확도를 희생시키는 대가로 얼굴 표정의 다양성을 얼마나 향상시키는가?
- RQ4확산 기반 Transformer가 고성능의 얼굴 애니메이션을 유지하면서도 빠르고 병렬적인 추론을 수행할 수 있는가?
- RQ5작업에 특화된 attention 편향은 일반적 또는 균일한 편향 설계 방식에 비해 성능 및 내구성 측면에서 어떻게 비교되는가?
주요 결과
- DiffSpeaker는 기존 벤치마크에서 최신 기술 수준의 성능을 달성하여, Facial Detail Distance (FDD)와 Lip Video Error (LVE) 지표에서 기존 방법을 모두 앞서 간다.
- 전체 얼굴 운동 시퀀스를 병렬로 생성함으로써 빠른 추론 속도를 달성하였으며, 10–90초 오디오 클립의 평균 지연 시간이 순차적 추론 기반 기준보다 크게 낮다.
- 교차 attention 편향을 제거할 경우 성능에 심각한 하락이 발생하여 LVE가 12.3% 증가하고 FDD가 8.7% 증가함으로써, 이 편향이 오디오-운동 정렬에 핵심적인 역할을 한다는 것을 입증한다.
- 자기 attention 편향을 포함시킴으로써 시간적 연속성 모델링이 향상되어 운동의 진동을 줄이고 얼굴 운동의 현실감을 향상시킨다.
- FaceFormer 스타일의 편향을 사용할 경우 작업에 특화된 편향보다 성능이 열등하여, 조건 인식 편향 설계의 必요성을 확인한다.
- 모델는 랜덤 시드에 관계없이 안정적인 결과를 유지하며, 좁은 신뢰구간을 보이며, 무조건적 지시에 의존하지 않고도 강건하고 신뢰할 수 있는 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.