[논문 리뷰] Deep Video Portraits
이 논문은 공간-시간 아키텍처를 갖춘 생성 신경망인 Deep Video Portraits를 소개한다. 이는 원본 연기자에서 전체 3D 헤드 동작, 표정, 시선, 깜빡임을 대상에 전달하여 포트레이트 영상의 사진처럼 생생한 재생영상을 가능하게 한다. 이 방법은 매개변수화된 얼굴 모델의 합성 렌더링에 대해 적대적 훈련을 사용하여 현실적인 영상 프레임을 생성하며, 머리카락, 몸체 또는 배경을 명시적으로 모델링하지 않아도 고해상도 재현이 가능하다.
We present a novel approach that enables photo-realistic re-animation of portrait videos using only an input video. In contrast to existing approaches that are restricted to manipulations of facial expressions only, we are the first to transfer the full 3D head position, head rotation, face expression, eye gaze, and eye blinking from a source actor to a portrait video of a target actor. The core of our approach is a generative neural network with a novel space-time architecture. The network takes as input synthetic renderings of a parametric face model, based on which it predicts photo-realistic video frames for a given target actor. The realism in this rendering-to-video transfer is achieved by careful adversarial training, and as a result, we can create modified target videos that mimic the behavior of the synthetically-created input. In order to enable source-to-target video re-animation, we render a synthetic target video with the reconstructed head animation parameters from a source video, and feed it into the trained network -- thus taking full control of the target. With the ability to freely recombine source and target parameters, we are able to demonstrate a large variety of video rewrite applications without explicitly modeling hair, body or background. For instance, we can reenact the full head using interactive user-controlled editing, and realize high-fidelity visual dubbing. To demonstrate the high quality of our output, we conduct an extensive series of experiments and evaluations, where for instance a user study shows that our video edits are hard to detect.
연구 동기 및 목표
- 포트레이트 영상에서 얼굴 표정을 넘어서 머리 위치, 자세, 표정, 시선, 깜빡임을 포함한 전체 3D 헤드 재생영상을 가능하게 하는 것.
- 머리카락, 몸체 또는 배경을 명시적으로 모델링하지 않고도 사진처럼 생생한 영상 생성을 달성하는 것.
- 엔드 투 엔드 학습을 통해 상호작용 가능하고 사용자 제어가 가능한 영상 재연 및 고해상도 더빙을 가능하게 하는 것.
- 원본 영상의 동작 파라미터를 대상 영상으로 전달하면서도 정체성과 현실감을 유지하는 방법을 개발하는 것.
제안 방법
- 매개변수화된 얼굴 모델의 합성 렌더링에서 사진처럼 생생한 영상 프레임을 예측하기 위해 새로운 공간-시간 생성 신경망 아키텍처를 사용한다.
- 원본 영상에서 복구된 헤드 애니메이션 파라미터를 바탕으로 합성 렌더링을 생성하여 원본에서 대상으로의 재생영상 가능하게 한다.
- 영상 생성 과정에서 현실감을 향상시키기 위해 적대적 훈련을 적용하여 고해상도의 시각적 정확도를 확보한다.
- 모델은 제어된 동작 파라미터를 가진 합성 입력 영상으로 훈련되어 대상 영상 출력에 대한 정밀한 제어를 가능하게 한다.
- 정체성(대상)과 동작(원본)을 분리하여 재훈련 없이도 유연하게 파라미터를 재조합할 수 있도록 한다.
- 사용자 제어 편집은 원본 동작 파라미터를 조작하고 훈련된 네트워크에 입력함으로써 지원된다.
실험 결과
연구 질문
- RQ1딥 생성 모델은 원본에서 대상 포트레이트 영상으로 전체 3D 헤드 동작(회전, 시선, 깜빡임 포함)을 사진처럼 생생한 결과로 전달할 수 있는가?
- RQ2배경이나 몸체를 명시적으로 모델링하지 않아도, 합성 렌더링에 대한 적대적 훈련이 영상 생성에서 높은 현실감을 얼마나 달성할 수 있는가?
- RQ3이 방법은 상호작용 가능하고 사용자 제어가 가능한 영상 재연 및 시각적 더빙에 얼마나 효과적인가?
- RQ4인지 평가에서 생성된 영상가 실재 영상과 신뢰성 있게 구분될 수 있는가?
주요 결과
- 이 방법은 머리 자세, 시선, 깜빡임을 포함한 전체 3D 헤드 동작을 원본에서 대상으로 고해상도의 시각적 정확도로 성공적으로 전달한다.
- 사용자 연구 결과, 생성된 영상 편집이 감지하기 어려운 것으로 나타나 강력한 인지적 현실감을 입증한다.
- 이 방법은 머리카락, 몸체 또는 배경을 명시적으로 모델링하지 않아도 고해상도의 시각적 더빙과 상호작용 가능한 재연을 가능하게 한다.
- 합성 렌더링에 대한 적대적 훈련은 생성된 영상 프레임의 현실감을 크게 향상시킨다.
- 원본 및 대상 입력의 파라미터 재조합을 통해 대상 영상의 행동을 완전히 제어할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.