[논문 리뷰] Unpaired Photo-to-Caricature Translation on Faces in the Wild
이 논문은 쌍이 없는, 실제 세계의 얼굴에 대해 GAN 기반의 방법을 제안하며, 이중 경로 생성자와 군집 및 세부 구분자, 지각 손실, 보조 노이즈를 사용하여 사진에서 카리커처로의 변환을 수행한다. 이 방법은 표정과 전반적인 구조를 유지하면서도 표현적이고 과장되며 현실적인 카리커처를 생성하는 데 최첨단 성능을 달성한다.
Recently, image-to-image translation has been made much progress owing to the success of conditional Generative Adversarial Networks (cGANs). And some unpaired methods based on cycle consistency loss such as DualGAN, CycleGAN and DiscoGAN are really popular. However, it's still very challenging for translation tasks with the requirement of high-level visual information conversion, such as photo-to-caricature translation that requires satire, exaggeration, lifelikeness and artistry. We present an approach for learning to translate faces in the wild from the source photo domain to the target caricature domain with different styles, which can also be used for other high-level image-to-image translation tasks. In order to capture global structure with local statistics while translation, we design a dual pathway model with one coarse discriminator and one fine discriminator. For generator, we provide one extra perceptual loss in association with adversarial loss and cycle consistency loss to achieve representation learning for two different domains. Also the style can be learned by the auxiliary noise input. Experiments on photo-to-caricature translation of faces in the wild show considerable performance gain of our proposed method over state-of-the-art translation methods as well as its potential real applications.
연구 동기 및 목표
- 사진에서 카리커처로의 고수준 이미지 간 변환에 도전하는 데 목적이 있으며, 과장, 풍자, 예술성, 현실감이 요구된다.
- 다양한 수신 영역을 가진 이중 구분자를 도입하여 현실적인 얼굴 구조와 과장된 특징을 구분할 수 있는 구분자 능력을 향상시킨다.
- 목표 도메인 통계와 일치시키기 위해 추가적인 지각 손실을 통해 특징 일관성과 지각 품질을 향상시킨다.
- 보조 노이즈를 스타일 제어 메커니즘으로 통합함으로써 스타일 다양성과 모델의 강건성을 향상시킨다.
- 정제된 데이터 세트를 초월하여 다양한 비구속적 얼굴 데이터 세트에서의 일반화 능력과 실제 적용 가능성을 입증한다.
제안 방법
- 전체적인 얼굴 구조에 초점을 맞춘 군집 구분자와 국소적인 얼굴 통계를 캡처하는 세부 구분자를 갖춘 이중 경로 GAN 아키텍처.
- 대부분의 생성자 네트워크는 적대적 손실, 사이클 일관성 손실, 그리고 정체성 유지와 과장된 현실감 향상을 위한 추가 지각 손실을 통해 훈련된다.
- 보조 노이즈가 생성자에 주입되어 과장 강도 및 예술 스타일과 같은 스타일적 속성을 분리하고 제어할 수 있도록 한다.
- 노이즈 증강 훈련은 모델의 강건성을 향상시켜 고노이즈 비율 입력 시에도 일관된 출력을 유지할 수 있도록 한다.
- 개선된 감독을 갖춘 수정된 CycleGAN 목표 함수를 사용하여 쌍이 없는 사진 및 카리커처 데이터 세트에서 엔드 투 엔드로 훈련된다.
- 지각 손실은 사전 훈련된 VGG 네트워크의 특징을 사용하여 입력 이미지와 변환된 이미지 간의 의미적 및 구조적 일관성을 강제한다.
실험 결과
연구 질문
- RQ1쌍이 없는 훈련 데이터 없이도 GAN 기반 방법이 비구속적이고 실제 세계의 얼굴 사진을 다양한 예술적 카리커처로 효과적으로 변환할 수 있는가?
- RQ2군집 및 세부 이중 구분자를 사용할 경우, 전반적인 얼굴 구조를 유지하면서 국소적인 특징을 과장하는 데 모델의 능력이 향상되는가?
- RQ3추가적인 지각 손실이 생성된 카리커처의 현실감과 정체성 유지에 어느 정도 기여하는가?
- RQ4보조 노이즈를 효과적으로 활용하여 생성된 카리커처의 예술 스타일을 제어하고 다양화할 수 있는가?
- RQ5특히 비구속적이고 실제 세계의 얼굴 이미지에서 복잡한 배경과 노이즈가 포함된 입력에 대해 모델은 얼마나 강건한가?
주요 결과
- 제안된 방법은 IIIT-CFW, PHOTO-SKETCH, CelebA 등 여러 벤치마크에서 최첨단의 쌍이 없는 이미지 간 변환 방법을 능가하며 고품질 카리커처를 생성한다.
- 이중 구분자 설계는 전체적인 얼굴 레이아웃과 눈, 코, 입과 같은 국소적인 얼굴 세부 사항을 더 잘 캡처할 수 있도록 성능을 크게 향상시킨다.
- 지각 손실의 추가로 얼굴 표정과 기관 정렬 측면에서 더 현실적이고 정체성을 유지하는 카리커처가 생성된다.
- 보조 노이즈 주입은 제어 가능한 스타일 변형을 가능하게 하며, 다양한 노이즈 비율이 다른 예술 스타일의 출력을 생성한다.
- 모델은 높은 노이즈 입력(최대 50%)에 대해 강건성을 유지하며 의미 있고 일관된 카리커처 생성을 수행한다.
- KDEF, Yale, FEI, CelebA 등 다양한 데이터 세트에서 잘 일반화되며, 비구속적 얼굴 이미지에서 감정 표현과 구조 일관성을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.