[논문 리뷰] AniGAN: Style-Guided Generative Adversarial Networks for Unsupervised Anime Face Generation
AniGAN은 참조 애니메이션 얼굴에서 색상, 질감 및 국소적 얼굴 형상 스타일을 전이하면서도 전반적인 사진 얼굴의 구조를 유지하는 스타일 가이드 GAN 프레임워크를 제안한다. 다중 수준 스타일 주입 생성기와 PoLIN, AdaPoLIN 정규화를 도입하였으며, 현실감 있는 결과를 얻고 잡음과 기형을 줄이기 위해 이중 분류기 구조를 도입하여 FID 및 LPIPS 지표에서 기존 최고 성능(SOTA) 방법들을 능가한다.
In this paper, we propose a novel framework to translate a portrait photo-face into an anime appearance. Our aim is to synthesize anime-faces which are style-consistent with a given reference anime-face. However, unlike typical translation tasks, such anime-face translation is challenging due to complex variations of appearances among anime-faces. Existing methods often fail to transfer the styles of reference anime-faces, or introduce noticeable artifacts/distortions in the local shapes of their generated faces. We propose AniGAN, a novel GAN-based translator that synthesizes high-quality anime-faces. Specifically, a new generator architecture is proposed to simultaneously transfer color/texture styles and transform local facial shapes into anime-like counterparts based on the style of a reference anime-face, while preserving the global structure of the source photo-face. We propose a double-branch discriminator to learn both domain-specific distributions and domain-shared distributions, helping generate visually pleasing anime-faces and effectively mitigate artifacts. Extensive experiments on selfie2anime and a new face2anime dataset qualitatively and quantitatively demonstrate the superiority of our method over state-of-the-art methods. The new dataset is available at https://github.com/bing-li-ai/AniGAN .
연구 동기 및 목표
- 참조된 스타일과 기하학적으로 타당한 애니메이션 얼굴을 생성하는 데 도전하는 것.
- 기존 GAN이 정체성을 유지하면서도 국소적 얼굴 형상 스타일(예: 큰 눈, 작은 입)을 전이하지 못하는 한계를 극복하는 것.
- 단지 참조 애니메이션 이미지만을 사용하여 사진 얼굴에서 애니메이션 얼굴로의 비쌍체적(unsupervised) 번역을 가능하게 하는 것.
- 스타일과 형상 전이의 불일치로 인한 생성된 얼굴의 잡음과 기형을 완화하는 것.
- 강력하고 분리된 생성 아키텍처를 통해 애니메이션 스타일의 광범위한 내부 변동성을 모델링하는 것.
제안 방법
- 새로운 생성기 아키텍처가 다중 수준 디코더 특징 맵에 스타일 정보를 주입하여 색상/질감 전이와 동시에 국소적 얼굴 형상의 애니메이션 스타일로의 변형을 동시에 가능하게 한다.
- 이 방법은 얼굴 파싱이나 랜드마크 검출에 의존하지 않고 스타일 전이와 국소적 형상 적응을 향상시키기 위해 PoLIN(Porgressive Instance Normalization)과 AdaPoLIN(Adaptive PoLIN)을 도입한다.
- 이중 분류기 구조는 도메인 특화 분포(사진 얼굴 및 애니메이션 얼굴)와 공통 특징 공간을 함께 학습하여 현실감 있는 결과를 얻고 잡음을 줄인다.
- 생성기는 스킵 연결과 다중 척도 특징 융합을 사용하여 스타일 전이 과정에서 원본 사진 얼굴의 전반적인 자세와 정체성을 유지한다.
- 이 프레임워크는 쌍체가 없는 데이터에서 비쌍체적으로 학습되며, 사이클 일致성 및 적대적 손실을 사용하여 학습 안정성을 확보한다.
- 분류기의 공통 얕은 층은 진짜 사진 얼굴 통계를 활용하여 애니메이션 분류기의 현실적인 얼굴 특징 학습을 돕는다.
실험 결과
연구 질문
- RQ1쌍체가 없는 데이터에서 참조 애니메이션 얼굴에서 색상/질감과 국소적 얼굴 형상 스타일을 사진 얼굴로 효과적으로 전이할 수 있는가?
- RQ2깊은 생성 프레임워크에서 국소적 얼굴 형상 변형(예: 큰 눈)을 스타일 전이의 한 형태로 어떻게 모델링할 수 있는가?
- RQ3사진 얼굴과 애니메이션 얼굴 분포를 함께 모델링하는 이중 분류기 구조가 생성 품질 향상과 잡음 감소에 기여하는가?
- RQ4기존 정규화 기법에 비해 PoLIN 및 AdaPoLIN과 같은 새로운 정규화 레이어가 스타일 전이 및 형상 일관성 향상에 얼마나 기여하는가?
- RQ5모델은 다양한 애니메이션 스타일과 자세 변형에 대해 일반화되어 있으며 원본 정체성을 유지할 수 있는가?
주요 결과
- AniGAN은 selfie2anime 및 새로운 face2anime 데이터셋에서 기존 최고 성능(SOTA)을 기록하였으며, 경쟁 방법들보다 FID(18.7)와 LPIPS(0.21) 점수가 낮게 나타났다.
- 제거 실험 결과 PoLIN 또는 AdaPoLIN를 제거할 경우 성능 저하가 심각하게 발생하였으며, 특히 머리카락과 눈 부위에서 잡음과 형상 전이의 열악한 성능이 관찰되었다.
- 이중 분류기 구조는 단일 분류기 버전보다 우수한 성능을 보였으며, LPIPS는 0.04 감소, FID는 2.1 감소하여 얼굴 구조의 보존이 향상됨을 입증했다.
- 시각적 비교 결과 StarGAN-v2는 종종 머리카락과 자세를 기형적으로 변형시키지만, AniGAN은 원본 사진 얼굴과의 전반적인 일관성을 유지한다.
- 이 방법은 다양한 참조 스타일에 대해 조건부로 고해상도의 다양한 애니메이션 얼굴을 성공적으로 생성하였으며, 큰 자세 변화 조건에서도 안정적으로 작동한다.
- 제안된 정규화 레이어(PoLIN, AdaPoLIN)는 정량적 및 정성적 결과를 통해 국소적 형상 변형과 스타일 일관성 향상에 크게 기여함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.