[논문 리뷰] Attention-Based Lip Audio-Visual Synthesis for Talking Face Generation in the Wild
이 논문은 공간적 및 채널 주의 모듈을 Wav2Lip 프레임워크에 통합하여 입술 영역에 집중하도록 개선한 주의 기반 음성-시각 합성 모델인 AttnWav2Lip을 제안한다. 이 모델은 LRW, LRS2, LRS3 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하여 기준 모델 대비 LSE-D를 4.1% 감소시키고 LSE-C를 1.9% 향상시켰다.
Talking face generation with great practical significance has attracted more attention in recent audio-visual studies. How to achieve accurate lip synchronization is a long-standing challenge to be further investigated. Motivated by xxx, in this paper, an AttnWav2Lip model is proposed by incorporating spatial attention module and channel attention module into lip-syncing strategy. Rather than focusing on the unimportant regions of the face image, the proposed AttnWav2Lip model is able to pay more attention on the lip region reconstruction. To our limited knowledge, this is the first attempt to introduce attention mechanism to the scheme of talking face generation. An extensive experiments have been conducted to evaluate the effectiveness of the proposed model. Compared to the baseline measured by LSE-D and LSE-C metrics, a superior performance has been demonstrated on the benchmark lip synthesis datasets, including LRW, LRS2 and LRS3.
연구 동기 및 목표
- 비구속적인 대화형 얼굴 생성 환경, 특히 실제 환경(인 월드) 영상 설정에서의 정확하지 않은 입술 동기화 문제를 해결하기 위해.
- 학습 중 모델의 집중을 입술 영역으로 유도하여 입술 영역 재구성 성능를 향상시키고, 관련이 없는 얼굴 영역에 대한 주의를 줄이기 위해.
- 특히 공간적 및 채널 주의를 포함한 주의 메커니즘 통합의 효과를 조사하기 위해.
- 언어별 미세조정 없이도 다양한 데이터셋에서 강건한 입술 동기화 성능를 확보하고, 미리 보지 않은 데이터에 대해 제로샷 추론을 가능하게 하기 위해.
- 주의 메커니즘이 기존의 GAN 기반 또는 오토에코더 기반 접근 방식을 초월해 입술 동기화 정확도를 크게 향상시킬 수 있음을 입증하기 위해.
제안 방법
- Wav2Lip 생성기 네트워크의 합성곱 블록에 공간 주의 모듈(SAM)과 채널 주의 모듈(CAM)을 통합한다.
- CBAM 스타일의 주의 모듈을 활용하여 특징 맵을 기반으로 주의 맵을 계산하고, 중요도가 높은 공간적 위치와 채널 별 특징 반응을 강조한다.
- 주의 모듈을 추가할 때 기울기 흐름을 유지하고 학습을 안정화시키기 위해 잔차 연결을 적용한다.
- 대부분의 경우 수동으로 조정된 동기화 페널티 가중치(α = 0.03)를 사용하여 적대적 학습을 수행하기 위해 사전 훈련된 입술 동기화 판별자를 활용한다.
- L1 재구성 손실과 음성-시각 동기화 손실(Lsync)의 조합을 사용하여 모델을 훈련하고, S3FD를 통한 얼굴 검출 및 96×96×3 크기로의 리사이징을 통해 데이터 증강을 실시한다.
- 표준 스케줄링 하에서는 수렴하지 못하므로, 고정된 α = 0.03로 사전 훈련된 Wav2Lip 체크포인트에서 미세조정을 수행하여 학습을 안정화시킨다.
실험 결과
연구 질문
- RQ1공간적 및 채널 주의 메커니즘의 통합이 비구속적인 대화형 얼굴 생성에서 입술 동기화 정확도를 향상시킬 수 있는가?
- RQ2모델의 주의를 입술 영역으로 유도하면 표준 합성곱 네트워크 대비 입술 움직임 재구성 성능가 향상되는가?
- RQ3공간적 및 채널 주의 모듈이 입술 동기화 성능에 각각 어떤 기여를 하는가? 그리고 어느 것이 더 효과적인가?
- RQ4제안된 주의 기반 모델은 미세조정 없이도 LRW, LRS2, LRS3와 같은 여러 벤치마크 데이터셋에 일반화 가능한가?
- RQ5기존의 SOTA 모델인 Wav2Lip 및 LipGAN을 초월해 주의 메커니즘이 동기화 지표(LSE-D 및 LSE-C) 향상에 효과적인가?
주요 결과
- 제안된 AttnWav2Lip 모델은 LRS3 데이터셋에서 7.339의 LSE-D 점수와 6.530의 LSE-C 점수를 기록하여 기준 모델인 Wav2Lip(7.521 LSE-D, 6.406 LSE-C)를 초월했다.
- 제거 실험 결과, 공간 주의와 채널 주의 모두 성능 향상에 기여하는 것으로 확인되었으며, 특히 공간 주의가 동기화 정확도 향상에 더 크게 기여했다.
- 공간 주의 맵 시각화 결과, 모델이 명시적으로 입술 영역에 집중하고 있으며, 높은 주의 가중치가 입술 영역에 집중되어 있음을 확인할 수 있었다.
- 기준 모델인 Wav2Lip 대비 LSE-D는 4.1% 감소시키고 LSE-C는 1.9% 향상시켜 모든 테스트된 데이터셋에서 일관된 성능 향상을 입증했다.
- 모델은 사전 훈련된 Wav2Lip 체크포인트에서 미세조정 없이도 LRW, LRS2, LRS3에서 제로샷 추론 성능가 뛰어나, 뛰어난 일반화 능력을 보였다.
- 학습을 안정화시키기 위해 동기화 페널티 가중치(α = 0.03)를 수동으로 조정할 필요가 있었으며, 원래의 적응형 스케줄링은 Lsync를 0.75 이하로 내리지 못해 실패했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.