Skip to main content
QUICK REVIEW

[논문 리뷰] V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation

Cong Wang, Kuan Tian|arXiv (Cornell University)|2024. 06. 04.
Augmented Reality Applications인용 수 4
한 줄 요약

V-Express는 포트레이트 영상 생성에서 다중 모odal 제어 신호의 균형을 맞추기 위해 조건부 드롭아웃과 점진적 훈련 전략을 제안한다. 이는 효과적인 오디오 주도 입술 동기화를 가능하게 하며, 정체성과 자세 제어를 유지한다. 이 방법은 상태 기반 영상 품질과 정렬을 달성했으며, AVSpeech에서 SyncNet 점수 3.480, TalkingHead-1KH에서 FID 23.38을 기록하여 확산 기반 생성에서 강력한 오디오 제어 능력을 입증한다.

ABSTRACT

In the field of portrait video generation, the use of single images to generate portrait videos has become increasingly prevalent. A common approach involves leveraging generative models to enhance adapters for controlled generation. However, control signals (e.g., text, audio, reference image, pose, depth map, etc.) can vary in strength. Among these, weaker conditions often struggle to be effective due to interference from stronger conditions, posing a challenge in balancing these conditions. In our work on portrait video generation, we identified audio signals as particularly weak, often overshadowed by stronger signals such as facial pose and reference image. However, direct training with weak signals often leads to difficulties in convergence. To address this, we propose V-Express, a simple method that balances different control signals through the progressive training and the conditional dropout operation. Our method gradually enables effective control by weak conditions, thereby achieving generation capabilities that simultaneously take into account the facial pose, reference image, and audio. The experimental results demonstrate that our method can effectively generate portrait videos controlled by audio. Furthermore, a potential solution is provided for the simultaneous and effective use of conditions of varying strengths.

연구 동기 및 목표

  • 포트레이트 영상 생성에서 강한 신호(예: 자세, 기준 이미지)가 약한 신호(예: 오디오)를 지배하는 경향으로 인한 제어 신호 강도의 불균형을 해결하기 위해.
  • 일반적으로 강한 신호에 의해 간섭받는 바람에 영향을 미치지 못하는 오디오와 같은 약한 제어 신호를 효과적이고 안정적으로 훈련시킬 수 있도록 하기 위해.
  • 다양한 강도를 가진 여러 제어 신호를 단일 생성 프레임워크에서 동시에 효과적으로 통합할 수 있는 방법을 개발하기 위해.
  • 생성된 포트레이트 영상에서 얼굴 정체성과 자세 일관성을 유지하면서 오디오 주도 입술 동기화를 향상시키기 위해.

제안 방법

  • V-Express는 VAE 인코더와 디코더를 갖춘 잠재 확산 모델(Latent Diffusion Model, LDM)을 사용하여 잠재 공간에서 이미지에서 영상으로의 생성을 수행한다.
  • 세 가지 제어 헤드를 사용한다: 정체성 제어를 위한 ReferenceNet, 얼굴 자세 제어를 위한 V-Kps Guider, 오디오 주도 입술 운동 제어를 위한 Audio Projection.
  • 훈련 중 조건부 드롭아웃을 적용한다: V-Kps와 기준 이미지 특징이 각각 50%와 20%의 드롭아웃 비율로 무작위로 마스킹되어 그들의 지배력을 감소시킨다.
  • 점진적 훈련은 약한 신호(예: 오디오)의 강도를 단계적으로 증가시킴으로써, 드롭아웃 비율과 신호 주입을 훈련 단계에 따라 스케줄링함으로써 약한 신호의 수렴과 제어 정밀도를 향상시킨다.
  • 모델은 다단계 훈련 파이프라인을 사용한다: 단계 I은 오디오 없이 영상 프레임에서 훈련( VFHQ 사용), 단계 II와 III는 점차적으로 오디오를 도입하고 제어를 정교화한다.
  • 확산 모델의 크로스 어텐션 웨이트를 분석하여 오디오 어텐션을 조절해 입술 운동에 영향을 줄 수 있음을 확인함으로써, 신호의 제어 가능성 확인.
Figure 1: The framework of V-Express.
Figure 1: The framework of V-Express.

실험 결과

연구 질문

  • RQ1강한 신호(예: 자세, 기준 이미지)가 지배하는 상황에서 오디오와 같은 약한 제어 신호가 포트레이트 영상 생성에 효과적으로 통합될 수 있는가?
  • RQ2점진적 훈련과 조건부 드롭아웃은 다중 조건 생성에서 약한 신호의 수렴과 제어 정밀도를 어떻게 향상시키는가?
  • RQ3얼굴 정체성이나 자세 정확도를 훼손하지 않고 오디오 주도 입술 동기화를 어느 정도 달성할 수 있는가?
  • RQ4제시된 방법은 다양한 강도를 가진 다수의 제어 신호를 균형 있게 조절하면서도 높은 영상 품질과 시간적 일관성을 유지할 수 있는가?

주요 결과

  • V-Express는 AVSpeech 데이터셋에서 SyncNet 점수 3.480을 기록하여 Wav2Lip(6.890)과 DiffusedHeads(점수 미기재)를 능가함으로써 뛰어난 입술 동기화 성능을 입증한다.
  • TalkingHead-1KH 데이터셋에서 V-Express는 FID 25.81과 FVD 135.82를 기록했으며, Wav2Lip(FID: 29.06, FVD: 250.95)과 DiffusedHeads(FID: 115.41, FVD: 344.69)를 상당히 앞서며 성능을 뛰어나게 한다.
  • TalkingHead-1KH에서 정체성 편차는 3.63(ΔFaceSim) 감소하여 지표와 비교해도 강력한 얼굴 정체성 유지 능력을 보여준다.
  • KpsDis는 TalkingHead-1KH에서 3.28로 감소하여 생성된 영상과 목표 얼굴 자세 간의 정렬성이 향상됨을 보여준다.
  • 시각적 결과는 오디오 어텐션 웨이트를 조절해 입술 운동 강도를 조절할 수 있음을 확인하여 오디오 신호의 제어 가능성 검증.
  • 제거 실험 결과 조건부 드롭아웃이 강한 신호의 간섭을 효과적으로 줄여 오디오가 생성에 의미 있는 영향을 미칠 수 있음을 확인했다.
Figure 2: Some results of V-Express.
Figure 2: Some results of V-Express.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.