Skip to main content
QUICK REVIEW

[논문 리뷰] DINet: Deformation Inpainting Network for Realistic Face Visually Dubbing on High Resolution Video

Zhimeng Zhang, Zhipeng Hu|arXiv (Cornell University)|2023. 03. 07.
Advanced Image Processing Techniques인용 수 4
한 줄 요약

이 논문은 고해상도 영상에서 고성능, 사진처럼 사실적인 얼굴 시각적 더빙을 위한 Deformation Inpainting Network인 DINet을 제안한다. 음성에 의해 유도되는 입모양과 머리 자세에 맞게 참조 얼굴 특징 맵을 공간적으로 변형하고, 학습된 디코더를 사용해 입 부위를 인painting함으로써, 직접 생성 방법에 비해 고주파 성분의 질감 세부 정보를 더 잘 유지한다. 고해상도 벤치마크에서 정성적 및 정량적 평가 모두에서 최신 기술(SOTA) 수준의 성능을 달성한다.

ABSTRACT

For few-shot learning, it is still a critical challenge to realize photo-realistic face visually dubbing on high-resolution videos. Previous works fail to generate high-fidelity dubbing results. To address the above problem, this paper proposes a Deformation Inpainting Network (DINet) for high-resolution face visually dubbing. Different from previous works relying on multiple up-sample layers to directly generate pixels from latent embeddings, DINet performs spatial deformation on feature maps of reference images to better preserve high-frequency textural details. Specifically, DINet consists of one deformation part and one inpainting part. In the first part, five reference facial images adaptively perform spatial deformation to create deformed feature maps encoding mouth shapes at each frame, in order to align with the input driving audio and also the head poses of the input source images. In the second part, to produce face visually dubbing, a feature decoder is responsible for adaptively incorporating mouth movements from the deformed feature maps and other attributes (i.e., head pose and upper facial expression) from the source feature maps together. Finally, DINet achieves face visually dubbing with rich textural details. We conduct qualitative and quantitative comparisons to validate our DINet on high-resolution videos. The experimental results show that our method outperforms state-of-the-art works.

연구 동기 및 목표

  • 소수의 샘플로 고해상도 영상에서 사진처럼 사실적인 얼굴 시각적 더빙을 생성하는 데 도전하는 것.
  • 직접 픽셀 생성 방법이 입 부위의 고주파 질감 세부 정보를 유지하지 못하는 한계를 극복하는 것.
  • 엔드 투 엔드 생성이 아닌 참조 이미지 특징의 공간적 변형을 활용해 입 동작 동기화와 얼굴의 현실감을 향상시키는 것.
  • 음성에 기반한 입 움직임과 정확히 일치시키면서도 신원, 머리 자세, 상반면 표정 일관성을 유지하는 것.
  • 기존 최신 기술 대비 고해상도 영상 데이터셋에서 뛰어난 성능을 달성하는 것.

제안 방법

  • DINet는 두 가지 주요 구성 요소로 이루어져 있다: 변형 부분과 인painting 부분.
  • 변형 부분은 음성과 소스 얼굴의 머리 자세에 기반해 다섯 개의 참조 얼굴 이미지에서 유도된 특징 맵을 변형하는 적응형 공간 변형(AdaAT)을 사용한다.
  • AdaAT는 정규화를 포함한 영역 수준의 변형을 수행하여 주로 주의 메커니즘이나 조밀한 플로우와 같은 픽셀 수준 방법보다 구조적이고 질감 세부 정보를 더 잘 유지한다.
  • 인painting 부분은 변형된 입 부위 특징과 소스 얼굴 특징(머리 자세 및 상반면 표정 포함)을 컨볼루션 디코더를 통해 융합하여 입 부위를 재구성한다.
  • 네트워크는 현실감과 일치를 보장하기 위해 지각적, 적대적, 음성-시각 동기화 손실을 함께 훈련한다.
  • 제거 실험을 통해 변형 기법이 직접 생성보다 효과적임을 입증하고, 주의나 조밀한 플로우에 비해 AdaAT가 특징 변형에서 뛰어난 성능을 보임을 확인한다.

실험 결과

연구 질문

  • RQ1참조 이미지 특징의 공간적 변형이 고해상도 얼굴 시각적 더빙에서 고주파 질감 유지에 기여하는가?
  • RQ2직접 픽셀 생성에 비해 변형 기반 특징 조작 방식이 시각적 정확도와 입 동작 동기화 측면에서 어떻게 비교되는가?
  • RQ3다양한 변형 메커니즘(예: AdaAT 대비 주의, 조밀한 플로우)이 질감 유지와 잡음 생성에 어떤 영향을 미치는가?
  • RQ4소수 샘플 기반 방법이 음성에서 유도된 현실적인 입 움직임을 생성하면서도 신원과 머리 자세 일관성을 얼마나 잘 유지할 수 있는가?
  • RQ5제안된 변형-인painting 프레임워크가 고해상도 영상 벤치마크에서 기존 최신 기술을 능가하는가?

주요 결과

  • HDTF 데이터셋에서 DINet는 가장 높은 SSIM(0.9425), PSNR(30.0082), 가장 낮은 LPIPS(0.0289)를 기록하여 모든 제거 실험 및 SOTA 방법을 압도한다.
  • 제거 실험 결과, 변형 구성 요소를 제거하면 SSIM는 0.9147로 감소하고 PSNR는 26.1665로 떨어지며, 이는 변형이 세부 정보 유지에 핵심적인 역할을 한다는 것을 시사한다.
  • 인painting 모듈을 생략할 경우 눈에 띄는 잡음과 품질 저하가 발생하며, SSIM는 0.8691, PSNR는 26.0071로 감소하여 특징 융합의 필수성을 확인한다.
  • 주목이나 조밀한 플로우를 사용해 변형을 수행할 경우 LPIPS는 각각 0.0433과 0.0656으로 상승하고, 눈이나 시선선 같은 얼굴 구조에서 더 많은 잡음이 발생한다.
  • 사용자 연구 결과, DINet는 현실감 점수(5점 만점에 3.4점)를 기록하여 Wav2Lip(2.4점), ATVG(2.9점), MakeItTalk(3.1점), PC-AVS(3.3점)를 모두 앞서며 최고의 성능을 보였다.
  • 직접 생성 방식에서 자주 흐릿해지는 미세 질감, 예를 들어 수염이나 코주름 등도 효과적으로 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.