Skip to main content
QUICK REVIEW

[논문 리뷰] VToonify: Controllable High-Resolution Portrait Video Style Transfer

Shuai Yang, Liming Jiang|arXiv (Cornell University)|2022. 09. 22.
Generative Adversarial Networks and Image Synthesis인용 수 7
한 줄 요약

VToonify는 기존의 스타일 기반 기반 모델에서 요구하는 고정 크기 및 정렬된 얼굴 등의 제약을 극복하기 위해, 제어 가능하고 고해상도의 포트레이트 비디오 스타일 전이를 위한 새로운 완전 컨volution 네트워크 프레임워크를 제안한다. 사전 학습된 스타일 기반 기반 모델에서 데이터와 아키텍처를 정제하여 다중 척도의 콘텐츠 특징과 얼굴 파싱 맵을 활용함으로써, 정렬되지 않은 다양한 크기의 비디오 입력에 대해 고정밀도이고 시간적으로 일관된 스타일 전이가 가능하며, 스타일 강도, 색상, 구조에 대한 민감한 제어가 가능하다.

ABSTRACT

Generating high-quality artistic portrait videos is an important and desirable task in computer graphics and vision. Although a series of successful portrait image toonification models built upon the powerful StyleGAN have been proposed, these image-oriented methods have obvious limitations when applied to videos, such as the fixed frame size, the requirement of face alignment, missing non-facial details and temporal inconsistency. In this work, we investigate the challenging controllable high-resolution portrait video style transfer by introducing a novel VToonify framework. Specifically, VToonify leverages the mid- and high-resolution layers of StyleGAN to render high-quality artistic portraits based on the multi-scale content features extracted by an encoder to better preserve the frame details. The resulting fully convolutional architecture accepts non-aligned faces in videos of variable size as input, contributing to complete face regions with natural motions in the output. Our framework is compatible with existing StyleGAN-based image toonification models to extend them to video toonification, and inherits appealing features of these models for flexible style control on color and intensity. This work presents two instantiations of VToonify built upon Toonify and DualStyleGAN for collection-based and exemplar-based portrait video style transfer, respectively. Extensive experimental results demonstrate the effectiveness of our proposed VToonify framework over existing methods in generating high-quality and temporally-coherent artistic portrait videos with flexible style controls.

연구 동기 및 목표

  • 기존의 이미지 툰피케이션 모델이 비디오에 적용될 때 겪는 제약, 즉 고정 해상도, 얼굴 정렬 요구 사항, 시간적 불일치 문제를 해결하기 위해.
  • 정렬되지 않은 다양한 크기의 포트레이트 비디오에 대해 최대 1024×1024 해상도의 시간적으로 일관된 스타일 전이를 가능하게 하기 위해.
  • 사용자가 스타일 강도를 조절하고 스타일 컬렉션에서 참조 스타일을 선택할 수 있도록 가능한 영역에서의 영향력 있는 제어 가능한 스타일 전이를 지원하기 위해.
  • 구조적 및 색상 스타일 변화가 있더라도 비록 얼굴 외부의 세부 사항을 유지하고 정체성 일관성을 유지하기 위해.
  • 기존의 스타일 기반 기반 이미지 툰피케이션 모델을 비디오에 확장하면서도, 그들의 제어 가능성과 고품질 생성 능력을 그대로 유지하기 위해.

제안 방법

  • 프레임워크는 다양한 입력 크기를 처리하기 위해 완전 컨volution 네트워크를 사용하고, 고해상도 및 제어 가능한 스타일 생성을 위해 정제된 스타일 기반 기반 모델을 조합한 하이브리드 설계를 채택한다.
  • 에코더를 통해 다중 척도의 콘텐츠 특징를 추출하고, 사전 학습된 스타일 기반 기반 백본에서 유래한 스타일 코드와 융합하여 세밀한 이미지 재구성한다.
  • 특히 눈, 코 등의 미세한 세부 사항에 대해 구조적 정확도를 향상시키기 위해 얼굴 파싱 맵을 보조적 지도로 활용한다.
  • 스타일 코드 주입 메커니즘의 적응을 통해 컬렉션 기반(Toonify) 및 예시 기반(DualStyleGAN) 스타일 전이를 모두 지원한다.
  • 비디오 시퀀스에서 시간적 아티팩트를 줄이기 위해 균일한 광학 흐름 기반의 플리커 감소 손실을 적용한다.
  • 모델은 정제를 통해 학습되며, 스타일 기반 기반 모델에서 유도된 합성 쌍 데이터를 사용해 경량의 비디오 대응 네트워크를 지도한다.

실험 결과

연구 질문

  • RQ1비디오 스타일 전이 프레임워크는 얼굴 정렬이나 고정 입력 크기 없이도 고해상도(1024×1024) 및 시간적으로 일관된 스타일 전이를 달성할 수 있는가?
  • RQ2다중 척도의 콘텐츠 특징와 얼굴 파싱 맵은 비디오에서 스타일 전이된 얼굴의 구조적 정확도와 비얼굴 세부 사항의 정확도를 어떻게 향상시키는가?
  • RQ3프레임워크는 비디오 환경에서 스타일 강도 조절 및 기반 스타일 전이를 포함한 영향력 있는 스타일 제어를 어느 정도 지원할 수 있는가?
  • RQ4사전 학습된 스타일 기반 기반 모델에서 데이터와 아키텍처를 정제함으로써 성능과 일반화 능력에 어떤 영향을 미치는가?
  • RQ5프레임워크의 주요 실패 유형은 무엇이며, 이는 기반 스타일 기반 기반 모델의 편향과 어떻게 관련이 있는가?

주요 결과

  • VToonify는 고해상도 포트레이트 비디오 스타일 전이 분야에서 최고 성능을 기록하며, 정렬되지 않은 얼굴과 다양한 입력 크기 조건에서도 시간적으로 일관된 결과를 생성한다.
  • 얼굴 파싱 맵의 포함으로 인해 스타일 전이된 얼굴의 구조 정확도가 크게 향상되었으며, 특히 눈, 얼굴 윤곽 등의 미세한 세부 사항에서 두드러진다.
  • 프레임워크는 스타일 강도 조절 및 예시 기반 스타일 전이를 포함한 영향력 있는 스타일 제어를 지원하며, 결과가 참조 스타일 이미지와 매우 유사하게 유지된다.
  • 사전 학습된 스타일 기반 기반 모델에서 데이터와 모델을 정제함으로써 VToonify는 고품질 생성 능력을 그대로 이어받으면서도 원본 모델의 고정 해상도 및 정렬 제약을 극복한다.
  • 비록 장점이 많지만, 이는 스타일 기반 기반 모델의 한계를 그대로 이어받으며, 극단적인 얼굴 각도, 시선 방향, 특정 스타일에서의 흐린 배경 처리에 취약하다.
  • 균일한 광학 흐름 기반 손실을 통해 플리커 현상을 줄였지만, 채도가 높거나 복잡한 운동 영역에서는 일부 플리커 현상이 여전히 존재한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.