[논문 리뷰] Dynamic Neural Textures: Generating Talking-Face Videos with Continuously Controllable Expressions
이 논문은 실시간으로 고품질의 대화하는 얼굴 영상을 생성할 수 있는 연속 제어가 가능한 얼굴 표정을 갖춘 동적 신경 텍스처(DNT)를 제안한다. 표현을 립 모션과 분리하기 위해 학습 가능한 표현 조건부 신경 텍스처 맵과 3DMM 기반 기하 모델을 사용함으로써, 정밀한 사용자 제어가 가능한 표정 강도와 뛰어난 립 동기화를 달성하며, 정량적 지표와 사용자 연구에서 최신 기술들을 능가한다.
Recently, talking-face video generation has received considerable attention. So far most methods generate results with neutral expressions or expressions that are implicitly determined by neural networks in an uncontrollable way. In this paper, we propose a method to generate talking-face videos with continuously controllable expressions in real-time. Our method is based on an important observation: In contrast to facial geometry of moderate resolution, most expression information lies in textures. Then we make use of neural textures to generate high-quality talking face videos and design a novel neural network that can generate neural textures for image frames (which we called dynamic neural textures) based on the input expression and continuous intensity expression coding (CIEC). Our method uses 3DMM as a 3D model to sample the dynamic neural texture. The 3DMM does not cover the teeth area, so we propose a teeth submodule to complete the details in teeth. Results and an ablation study show the effectiveness of our method in generating high-quality talking-face videos with continuously controllable expressions. We also set up four baseline methods by combining existing representative methods and compare them with our method. Experimental results including a user study show that our method has the best performance.
연구 동기 및 목표
- 기존의 대화하는 얼굴 영상 생성 방법이 중립적 또는 제어 불가능한 표정을 생성하는 데서 비롯되는 한계를 해결하기 위해.
- 생성된 대화하는 얼굴 영상에서 얼굴 표정 강도와 유형에 대해 실시간으로 세밀한 제어를 가능하게 하기 위해.
- 시간적 일관성과 제어성을 향상시키기 위해 립 운동과 표정을 분리하기 위해.
- 특수 서브모듈을 사용하여 3DMM이 커버하지 못하는 이가 부족한 영역을 보완함으로써 입가 영역의 시각적 품질을 향상시키기 위해.
- 기존 최신 기술 대비 표정 제어성, 립 동기화, 시각적 품질 측면에서 뛰어난 성능을 달성하기 위해.
제안 방법
- 해당 방법은 고해상도 신경 텍스처를 동적 샘플링하기 위한 기하 기반으로 3D 모러포블 모델(3DMM)을 사용하며, 이는 표현 입력에 따라 조건화된 고차원의 학습 가능한 특징 맵이다.
- 새로운 분리 네트워크는 표현 표현을 립 운동과 머리 자세에서 분리하여, 표현 강도와 유형을 별도로 제어할 수 있도록 한다.
- 동적 신경 텍스처(DNT)는 연속 강도 표현 코딩(CIEC)에 조건화된 신경망을 통해 생성되며, 이는 실시간 연속 표현 제어를 가능하게 한다.
- 이가 부족한 영역의 누락된 세부 사항을 복원하기 위해 전용 서브모듈을 도입하여 입가 영역의 현실감을 향상시킨다.
- 신경 렌더링 기법을 사용하여 동적 신경 텍스처와 3D 기하를 기반으로 사진 수준의 프레임을 합성함으로써 고해상도의 시각적 정확도를 확보한다.
실험 결과
연구 질문
- RQ1고해상도 신경 텍스처에 표정 정보를 3D 기하보다 효과적으로 인코딩할 수 있는가? 이는 대화하는 얼굴 영상 생성에서 더 나은 표정 제어를 가능하게 하는가?
- RQ2표현 강도와 유형을 실시간으로 연속적으로 제어하면서도 립 동기화와 시간적 일관성을 유지할 수 있는가?
- RQ33D 얼굴 모델에서 표현을 립 운동과 머리 자세에서 효과적으로 분리할 수 있는 분리 네트워크가 가능한가?
- RQ4전용 이가 서브모듈이 생성된 대화하는 얼굴 영상의 입가 영역에서 시각적 품질을 어느 정도 향상시키는가?
- RQ5표현 제어성, 립 동기화, 시각적 품질 측면에서 제안된 방법이 최신 기술들과 비교해 어떻게 성능을 냈는가?
주요 결과
- 비교된 모든 방법들 중에서 최고의 PSNR(27.41)와 SSIM(0.892)를 기록하여 뛰어난 영상 품질을 입증한다.
- 테스트 세트에서 CSS 점수 6.71을 기록하여 지표 평균과 일치함을 보이며, 완벽한 립 동기화를 입증한다.
- 제거 실험 결과 동적 신경 텍스처나 분리 네트워크를 제거할 경우 성능 저하가 심각하게 발생함을 확인하여, 이들의 필수성을 입증한다.
- 이가 서브모듈은 정성적 결과와 사용자 연구 피드백을 통해 입가 영역의 시각적 품질 향상을 확인시켰다.
- 사용자 연구와 정량적 지표를 통해 제안된 방법이 Wav2Lip, StarGAN, ExprGAN, EVP를 포함한 모든 베이스라인 방법보다 표정 제어성과 현실감에서 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.