Skip to main content
QUICK REVIEW

[논문 리뷰] Task-agnostic Temporally Consistent Facial Video Editing

Meng Cao, Haozhi Huang|arXiv (Cornell University)|2020. 07. 03.
Face recognition and analysis참고 문헌 37인용 수 5
한 줄 요약

이 논문은 3D 모형화된 얼굴 모델과 새로운 3D 시간 손실을 활용하여 얼굴 교체와 재연출을 통합하는 작업에 종속되지 않고 시간적으로 일관된 얼굴 영상 편집 프레임워크인 TFVGAN을 제안한다. 동적 훈련 샘플 선택과 딥 블렌딩 네트워크를 결합함으로써 다양한 편집 작업에서 고해상도, 플리커 없는 영상 생성을 달성하며, 시간적 일관성과 현실성에서 최신 기술 수준의 성능을 보인다.

ABSTRACT

Recent research has witnessed the advances in facial image editing tasks. For video editing, however, previous methods either simply apply transformations frame by frame or utilize multiple frames in a concatenated or iterative fashion, which leads to noticeable visual flickers. In addition, these methods are confined to dealing with one specific task at a time without any extensibility. In this paper, we propose a task-agnostic temporally consistent facial video editing framework. Based on a 3D reconstruction model, our framework is designed to handle several editing tasks in a more unified and disentangled manner. The core design includes a dynamic training sample selection mechanism and a novel 3D temporal loss constraint that fully exploits both image and video datasets and enforces temporal consistency. Compared with the state-of-the-art facial image editing methods, our framework generates video portraits that are more photo-realistic and temporally smooth.

연구 동기 및 목표

  • 프레임 단위 또는 연결된 프레임 방법에서 발생하는 시각적 플리커링과 같은 시간적 일관성 문제를 해결한다.
  • 특정 작업에 맞게 재학습이 필요 없이 얼굴 교체와 재연출을 포함한 여러 얼굴 영상 편집 작업을 하나의 확장 가능한 프레임워크로 통합한다.
  • 3D 얼굴 재구성을 활용하여 정체성, 자세, 표정을 분리 조작할 수 있도록 하여 더 큰 편집 자유도를 제공한다.
  • 동적 훈련 샘플 선택 메커니즘을 통해 이미지 및 영상 데이터 세트를 결합함으로써 훈련 효율성과 정확도를 향상시킨다.
  • 밀도 있는 광학 흐름과 기저 좌표 보간을 기반으로 한 새로운 3D 시간 손실을 통해 시간적 일관성을 강제한다.

제안 방법

  • 3D 모형화된 얼굴 모델(3DMM)을 사용하여 얼굴 이미지를 정체성, 자세, 표정 계수로 분리하여 통합된 조작를 가능하게 한다.
  • 훈련 중에 이미지 및 영상 데이터 세트를 번갈아가며 사용하는 동적 훈련 샘플 선택 메커니즘을 도입하여 다양성과 시간적 지도의 균형을 확보한다.
  • 기저 좌표 보간을 통한 밀도 있는 광학 흐름 맵을 활용하여 연속 프레임 간의 일관성을 강제하는 새로운 3D 시간 손실을 설계한다.
  • 래스터라이제이션 렌더러를 사용하여 분리된 3D 계수를 재결합하여 변환된 얼굴 시퀀스를 생성한다.
  • 딥 블렌딩 네트워크를 통해 렌더링된 얼굴를 보조적인 외관 힌트와 융합하여 사진 수준의 현실적인 출력을 생성한다.
  • 이미지 및 영상 데이터 세트의 혼합을 사용하여 전체 프레임워크를 적대적 방식으로 훈련함으로써 정확도와 일관성의 공동 최적화를 달성한다.

실험 결과

연구 질문

  • RQ1통합 프레임워크가 특정 작업에 맞게 설계하지 않고도 얼굴 교체 및 재연출과 같은 여러 얼굴 영상 편집 작업을 처리할 수 있는가?
  • RQ2특히 각 프레임 수준의 변환을 적용할 경우, 플리커링을 제거하기 위해 시간적 일관성을 명시적으로 강제할 수 있는가?
  • RQ3혼합된 이미지 및 영상 데이터 세트에서의 공동 훈련이 고립된 훈련에 비해 정확도와 시간적 일관성 향상에 얼마나 기여하는가?
  • RQ43D 얼굴 재구성이 2D 랜드마크 기반 방법을 초월하여 정체성, 자세, 표정의 분리 조작을 가능하게 할 수 있는가?
  • RQ5제안된 3D 시간 손실이 광학 오차를 줄이고, 프레임 간의 시각적 부드러움을 향상시키는 데 얼마나 효과적인가?

주요 결과

  • TFVGAN은 얼굴 재연출 작업에서 VoxCeleb2 데이터 세트에서 FID 24.4를 달성하여, 블렌딩 네트워크를 AdaIN으로 교체한 베이스라인(36.9)보다 유의미하게 뛰어난 성능을 보였다.
  • 절단 실험 결과, 3D 시간 손실을 제거할 경우 시간 오차 $E_{\text{tmp}}$ 가 3.65에서 4.69로 증가하여, 이 손실이 일관성 확보에 핵심적인 역할을 한다는 것을 확인했다.
  • 동적 훈련 샘플 선택 메커니즘이 영상 데이터만으로 훈련하는 것에 비해 시간 오차를 12.5% 감소시켜 일반화 능력 향상을 입증했다.
  • 배치 스타일 정규화(Batch Style Normalization, BSN) 레이어의 사용은 시각적 조화와 맥락 일관성을 향상시켜 AdaIN 대비 광학 오차를 15% 감소시켰다.
  • TFVGAN은 얼굴 교체 작업에서 시간 오차 $E_{\text{tmp}}$ 가 3.54, 재연출 작업에서 3.65를 기록하여 최신 기술 수준의 시간적 일관성 성능를 초월했다.
  • 시각화 결과, 3D 시간 손실이 큰 자세 변화 상황에서도 플리커링을 효과적으로 줄임을 확인하였으며, 손실 유무에 따른 상세 비교에서 뚜렷한 개선 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.