Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Speech-Aware Perceptual 3D Facial Expression Reconstruction from Videos

Panagiotis P. Filntisis, George Retsinas|arXiv (Cornell University)|2022. 07. 22.
Facial Nerve Paralysis Treatment and Research인용 수 7
한 줄 요약

이 논문은 음성 정보나 텍스트 전사 없이 영상에서 3D 얼굴 표정을 복원하는 데 있어 '립리드(licread)' 손실을 사용하여 입술 움직임의 정서적 현실감을 향상시키는 새로운 시각적 말하기 인식 기반 3D 얼굴 표면 재구성 방법을 제안한다. 사전 훈련된 입술 읽기 모델을 활용해 재구성된 영상과 실제 대화하는 얼굴 간의 정서적 불일치를 최소화함으로써, 기하학적 손실이나 지표 기반 손실보다 입술 움직임의 정밀도를 크게 향상시키며, 3D 대화하는 얼굴 생성의 정서적 자연스러움을 크게 향상시킨다.

ABSTRACT

The recent state of the art on monocular 3D face reconstruction from image data has made some impressive advancements, thanks to the advent of Deep Learning. However, it has mostly focused on input coming from a single RGB image, overlooking the following important factors: a) Nowadays, the vast majority of facial image data of interest do not originate from single images but rather from videos, which contain rich dynamic information. b) Furthermore, these videos typically capture individuals in some form of verbal communication (public talks, teleconferences, audiovisual human-computer interactions, interviews, monologues/dialogues in movies, etc). When existing 3D face reconstruction methods are applied in such videos, the artifacts in the reconstruction of the shape and motion of the mouth area are often severe, since they do not match well with the speech audio. To overcome the aforementioned limitations, we present the first method for visual speech-aware perceptual reconstruction of 3D mouth expressions. We do this by proposing a "lipread" loss, which guides the fitting process so that the elicited perception from the 3D reconstructed talking head resembles that of the original video footage. We demonstrate that, interestingly, the lipread loss is better suited for 3D reconstruction of mouth movements compared to traditional landmark losses, and even direct 3D supervision. Furthermore, the devised method does not rely on any text transcriptions or corresponding audio, rendering it ideal for training in unlabeled datasets. We verify the efficiency of our method through exhaustive objective evaluations on three large-scale datasets, as well as subjective evaluation with two web-based user studies.

연구 동기 및 목표

  • 영상에서 3D 얼굴 재구성을 할 때, 특히 말할 때 입술 움직임의 정서적 현실감이 부족한 문제를 해결하기 위해.
  • 기존의 2D 지표 및 3D 감독 방식이 말과 관련된 발음 기관의 세부 정보를 포착하지 못하는 한계를 극복하기 위해.
  • 인간의 말 듣기 인식과 일치하는 정서적 일관성을 갖춘 재구성된 3D 대화하는 얼굴을 개발하기 위해.
  • 텍스트 전사나 음성 데이터에 의존하지 않고 오직 시각적 데이터만으로 훈련할 수 있도록 하기 위해.
  • 정서적 손실이 기하학적 손실 및 직접적인 3D 감독보다 말과 관련된 얼굴 운동을 더 잘 모델링할 수 있음을 검증하기 위해.

제안 방법

  • 이 방법은 사전 훈련된 입술 읽기 모델을 사용해 렌더링된 3D 대화하는 얼굴와 원본 영상 간의 정서적 거리를 최소화하는 '립리드' 손실을 도입한다.
  • 립리드 손실은 최적화 과정 중에 적용되어 재구성된 입술 움직임이 원본 영상의 말 듣기 인식과 유사하게 작동하도록 3D 메쉬 피팅 과정을 이끌어낸다.
  • 정서적 현실감과 기하학적 정확도를 균형 있게 유지하기 위해 립리드 손실과 지표 기반 손실을 결합한다. 이는 과도한 최적화로 인한 아티팩트를 방지한다.
  • 최신 기술의 3D 얼굴 재구성 파이프라인(예: DECA 또는 유사 기법)을 활용하며, 3D 진짜 값이나 음성 데이터가 필요 없이도 정서적 손실을 추가로 통합한다.
  • 이 방법은 레이블이 없는 영상 데이터에서 엔드 투 엔드로 훈련되며, 대규모 실세계 응용에 적합하다.
  • 훈련 안정성을 높이고, 특히 립리드 손실만으로 아티팩트가 발생할 경우 형태 왜곡을 방지하기 위해 상대적 지표 손실을 사용한다.

실험 결과

연구 질문

  • RQ1입술 읽기 기반 정서적 손실이 영상에서 재구성된 3D 대화하는 얼굴의 입술 움직임의 현실감을 향상시킬 수 있는가?
  • RQ2립리드 손실이 전통적인 2D 지표 및 직접적인 3D 감독 방식보다 말과 관련된 얼굴 운동을 더 잘 재구성하는가?
  • RQ3텍스트 전사나 음성 데이터 없이도 3D 얼굴 재구성 방법이 높은 정서적 품질을 달성할 수 있는가?
  • RQ4립리드 손실과 지표 손실의 조합이 정서적 현실감과 기하학적 정밀도 사이의 트레이드오프에 어떤 영향을 미치는가?
  • RQ5말 영상으로만 훈련된 방법이 비말 운동에 대해서도 일반화되는가?

주요 결과

  • 객관적 및 주관적 평가를 통해 입술 읽기 기반 정서적 손실이 기존의 2D 지표 및 직접적인 3D 감독 방식보다 말과 관련된 입술 움직임 재구성에서 뚜렷한 성능 향상을 보였다.
  • 사용자 연구에서 이 방법은 정서적 품질이 뛰어나, 참가자들이 기준 방법보다 재구성된 대화하는 얼굴을 일관되게 선호했다.
  • 텍스트 전사나 음성 데이터에 접근할 수 없음에도 불구하고, 이 방법은 말 듣기 인식을 유지하는 3D 재구성을 생성하여, 오직 시각적 정서적 감독의 효과성을 입증했다.
  • 립리드 손실은 특히 이중 입술 자음과 둥근 모음과 같은 정서적 자연스러움에 핵심적인 요소인 입술 움직임을 더 명확하고 현실적으로 만들어냈다.
  • 비말 얼굴 운동으로의 일반화도 잘 이루어져, 학습된 표현 방식이 말에 국한되지 않고 일반적인 표정 운동을 포괄하고 있음을 시사한다.
  • 높은 정서적 성능에도 불구하고, CER 및 WER와 같은 객관적 지표는 도메인 갭으로 인해 여전히 높게 유지되며, 특히 이가나 혀의 세부 정보가 누락되어 있기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.