Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Domain Style Mixing for Face Cartoonization

Seungkwon Kim, Chaeheon Gwak|arXiv (Cornell University)|2022. 05. 25.
Face recognition and analysis인용 수 5
한 줄 요약

이 논문은 레이어 스위치된 StyleGAN2의 StyleSpace에서 자연 얼굴 도메인과 만화 도메인의 잠복 코드를 조합함으로써 단일 생성자만을 사용하여 고품질의 얼굴 만화화를 위한 새로운 방법인 Cross-Domain Style Mixing을 제안한다. 색상 왜곡을 해결하고 미세한 만화 특징을 유지하면서도 최소한의 훈련 데이터로도 작동하여, 간단한 캐릭터 ID 전환을 통해 여러 만화 캐릭터에 대한 한 번에 전체 스타일 전이가 가능하다.

ABSTRACT

Cartoon domain has recently gained increasing popularity. Previous studies have attempted quality portrait stylization into the cartoon domain; however, this poses a great challenge since they have not properly addressed the critical constraints, such as requiring a large number of training images or the lack of support for abstract cartoon faces. Recently, a layer swapping method has been used for stylization requiring only a limited number of training images; however, its use cases are still narrow as it inherits the remaining issues. In this paper, we propose a novel method called Cross-domain Style mixing, which combines two latent codes from two different domains. Our method effectively stylizes faces into multiple cartoon characters at various face abstraction levels using only a single generator without even using a large number of training images.

연구 동기 및 목표

  • 기존의 I2I 및 레이어 스위칭 방법이 만화 얼굴 스타일 전이에서 보여주는 한계, 특히 추상적인 만화 스타일로의 일반화 능력 부족과 색상 아티팩트 문제를 해결하기 위해.
  • 매우 추상적인 만화 얼굴을 처리할 때 이전의 레이어 스위칭 접근 방식에서 미세한 디테일 부족과 색상 왜곡을 극복하기 위해.
  • 각 캐릭터당 몇 장의 훈련 이미지만으로도 단일 생성자를 사용해 다양한 추상 수준의 여러 만화 캐릭터의 얼굴을 스타일 전이할 수 있도록 하기 위해.
  • 추가적인 훈련 기법이나 아키텍처 변경 없이도 안정적이고 효율적이며 구현 가능한 프레임워크를 개발하기 위해.
  • 사진에서 만화로, 영상에서 만화로의 변환과 같은 실용적 응용 분야로의 확장 가능성을 고려하여 시간에 따라 일관된 스타일 유지가 가능하도록 하기 위해.

제안 방법

  • 사용자 도메인의 자연 얼굴 이미지를 $\mathcal{W+}$ 공간으로 역추론하기 위해 사전 훈련된 인코더(예: ReStyle)를 사용한다.
  • 만화 이미지의 잠복 코드를 $\mathcal{W+}$ 공간에서 확보하기 위해 투영 프로토콜을 적용하여 소스 도메인과의 호환성을 확보한다.
  • 소스 도메인과 타겟 도메인의 잠복 코드를 사용하여 $\mathcal{S}$ 공간(StyleSpace)에서 스타일 믹싱을 수행함으로써 캐릭터 전용 스타일을 전이한다.
  • 출력의 색상 분포를 타겟 만화 도메인과 일치시키기 위해 $s_{tRGB}$ 스타일 파rameter들만 조작하는 tRGB 교체 기법을 도입함으로써 색상 아티팩트를 제거한다.
  • tRGB 교체를 스타일 믹싱과 조합하여 미세한 만화 디테일과 정확한 색상 분포를 모두 유지한다.
  • 유연한 프레임워크를 구축하여 사진에서 만화로, 영상에서 만화로의 변환과 같은 후속 응용 분야에 활용할 수 있도록 한다. 이는 시간에 따라 일관된 스타일 유지가 가능하도록 잠복 코드 믹싱을 통한 명시적이고 안정적인 스타일 주입을 가능하게 한다.

실험 결과

연구 질문

  • RQ1목표 만화 스타일이 매우 추상적이고 실제 얼굴과 크게 다를 경우, 얼굴 만화화의 품질과 안정성을 어떻게 향상시킬 수 있는가?
  • RQ2레이어 스위칭 기반 GAN 스타일 전이에서 색상 왜곡이 발생하는 원인은 무엇이며, 이를 체계적으로 어떻게 완화할 수 있는가?
  • RQ3다른 도메인의 잠복 코드를 조합하는 크로스 도메인 스타일 믹싱 기법이, 추가적인 훈련이나 아키텍처 수정 없이도 스타일 전이에 효과적으로 적용될 수 있는가?
  • RQ4단일 생성자가 최소한의 데이터로도 재훈련 없이 여러 만화 캐릭터에 대해 스타일 전이를 수행할 수 있는 정도는 어느 정도인가?
  • RQ5제안된 방법이 영상에서 만화로의 변환에 확장 가능할 수 있으며, 시간에 따라 스타일 전이가 일관성을 유지할 수 있는가?

주요 결과

  • tRGB 교체 기법은 $s_{tRGB}$ 스타일 파rameter들을 특별히 조작하여 스타일 전이 결과물의 색상 아티팩트를 성공적으로 제거했으며, 얼굴 구조에 영향을 주지 않았다.
  • StyleSpace에서의 스타일 믹싱은 고유한 입모양, 속눈썹 등 캐릭터 전용 특징을 효과적으로 전이한다.
  • $\mathcal{W+}$ 공간은 $\mathcal{W}$ 공간보다 더 우수한 미세한 만화 디테일 보존 성능을 보이며, 이는 역추론에 대한 타당성을 입증한다.
  • 전체 모델은 어떤 품질 저하 없이 고품질의 스타일 전이를 달성했으며, 기존의 레이어 스위칭 방법보다 시각적 정확도와 일관성 면에서 뛰어나다.
  • 이 방법은 한 번에 전체 스타일 전이 기능을 제공한다: 단일 생성자는 간단한 캐릭터 ID 전환만으로도 여러 캐릭터의 만화화된 얼굴을 생성할 수 있다.
  • 잠복 코드 믹싱을 통한 명시적이고 안정적인 스타일 주입 덕분에, 프레임 간 일관된 캐릭터 스타일 유지가 가능한 견고한 영상에서 만화로의 변환을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.