Skip to main content
QUICK REVIEW

[논문 리뷰] Disentangling Style and Content in Anime Illustrations

Sitao Xiang, Hao Li|arXiv (Cornell University)|2019. 05. 26.
Generative Adversarial Networks and Image Synthesis참고 문헌 25인용 수 10
한 줄 요약

이 논문은 두 단계적 접근 방식을 사용하여 애니메이션 일러스트의 스타일과 콘텐츠를 분리하는 생성적 적대적 분리 네트워크(GAN)를 제안한다: 먼저 이미지를 스타일에 영향을 받지 않는 콘텐츠 표현으로 인코딩하고, 그 다음 이중 조건부 생성기로 스타일과 콘텐츠를 독립적으로 제어한다. 이 방법은 얼굴 특징과 예술적 의미를 충실하게 유지하면서 1,000개 이상의 작가 전용 스타일에 걸쳐 고해상도이고 다양한 스타일 전이를 실현하여 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Existing methods for AI-generated artworks still struggle with generating high-quality stylized content, where high-level semantics are preserved, or separating fine-grained styles from various artists. We propose a novel Generative Adversarial Disentanglement Network which can disentangle two complementary factors of variations when only one of them is labelled in general, and fully decompose complex anime illustrations into style and content in particular. Training such model is challenging, since given a style, various content data may exist but not the other way round. Our approach is divided into two stages, one that encodes an input image into a style independent content, and one based on a dual-conditional generator. We demonstrate the ability to generate high-fidelity anime portraits with a fixed content and a large variety of styles from over a thousand artists, and vice versa, using a single end-to-end network and with applications in style transfer. We show this unique capability as well as superior output to the current state-of-the-art.

연구 동기 및 목표

  • 단일 인코딩 요소(예: 스타일)만 레이블이 지정된 복잡한 애니메이션 일러스트에서 스타일과 콘텐츠를 분리하는 문제를 해결하기 위해.
  • 단일 엔드 투 엔드 네트워크를 통해 고정된 콘텐츠와 가변적인 스타일을 갖춘 애니메이션 초상화를 고해상도로 생성하기 위해.
  • 기존 방법이 텍스처 통계에 의존하거나 도메인 별 트레이닝이 필요함에 비해, 공유된 분리 표현을 학습함으로써 이러한 제약을 극복하기 위해.
  • 애니메이션 외의 도메인으로의 일반화를 보여주기 위해, 손글씨 숫자에 적용하여 글쓰는 이 정체성과 숫자 종류를 분리하기 위해.

제안 방법

  • 두 단계 프레임워크: 첫째, 스타일에 영향을 받지 않는 콘텐츠 인코더가 입력 이미지를 스타일에 독립적인 콘텐츠 코드로 매핑한다.
  • 둘째, 이중 조건부 생성기가 콘텐츠 코드와 스타일 레이블을 입력으로 받아 이미지를 생성하며, 콘텐츠 무결성을 유지하기 위해 명시적 콘텐츠 복원 손실이 적용된다.
  • 적대적 훈련을 사용하여 보조 분류기 GAN을 활용해 현실적인 스타일 생성과 분리 성능을 보장한다.
  • 공유된 코드 공간을 사용해 엔드 투 엔드로 훈련되며, 콘텐츠와 스타일을 독립적으로 제어할 수 있다.
  • 다변량 정규분포가 콘텐츠 코드 공간을 모델링하여 평가를 위한 미사용된 콘텐츠 코드 생성이 가능하다.
  • 모델는 레이블이 지정된 스타일과 레이블이 지정되지 않은 콘텐츠만 사용하므로, 약한 지도 학습 설정에 적합하다.

실험 결과

연구 질문

  • RQ1스타일만 레이블이 지정된 경우에도 단일 생성 모델이 애니메이션 일러스트에서 스타일과 콘텐츠를 분리할 수 있는가?
  • RQ2콘텐츠 의미를 유지하면서 다양한 스타일을 갖춘 고해상도 초상화를 얼마나 잘 생성할 수 있는가?
  • RQ3암시적 조건부 처리에 비해 명시적 콘텐츠 조건부 처리가 분리 성능에 어떤 영향을 미치는가?
  • RQ4손글씨 숫자와 같이 다른 도메인으로 일반화할 수 있는가? 특히 하나의 요소만 레이블이 지정된 경우.
  • RQ5적대적 평가에서, 생성기 모델이 적대적 분류기의 공격에 대비해 얼마나 견고한가?

주요 결과

  • 모델은 얼굴 특징과 예술적 의미를 충실하게 재현하여 애니메이션 초상화에서 뛰어난 시각적 품질과 세부 사항 보존을 달성한다. 특히 눈, 머리카락, 볼살, 반사광과 같은 스타일 고유의 특징을 정확히 재현한다.
  • 적대적 분류기를 사용해 훈련한 생성기의 스타일 분류 정확도는 상위 1위 정확도 14.37%를 기록하여, 생성 샘플이 적대적 분류기에게 실제 샘플과 구분되지 않는다는 것을 보여준다.
  • 명시적 콘텐츠 조건부 처리를 제거하면 부분적인 모드 붕괴가 발생하여 콘텐츠 코드가 얼굴 특징를 제어하지 못함을 확인하였으며, 이는 콘텐츠 손실의 필요성을 입증한다.
  • NIST 손글씨 숫자 데이터셋에서, 단일 요소만 레이블이 지정된 상태에서도 글쓰는 이 정체성과 숫자 종류를 성공적으로 분리하였다.
  • 무작위 콘텐츠 코드를 사용해 총 106,814개의 샘플을 생성하였으며, 각 샘플은 훈련 세트의 클래스 분포를 충족시켜, 새로운 콘텐츠에 대한 일반화 능력을 검증하였다.
  • 적대적 분류기의 생성 샘플에 대한 낮은 정확도(14.37%)는 모델이 실제 데이터와 구분하기 어려운 현실적이고 다양한 출력를 생성할 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.