Skip to main content
QUICK REVIEW

[논문 리뷰] Photo-to-Caricature Translation on Faces in the Wild.

Ziqiang Zheng, Haiyong Zheng|arXiv (Cornell University)|2017. 11. 29.
Generative Adversarial Networks and Image Synthesis참고 문헌 25인용 수 7
한 줄 요약

이 논문은 자연계의 사진에서 카리커처로의 번역을 위해 이중 경로 기반 조건부 GAN을 제안하며, 병렬 컨볼루션 네트워크를 통합하여 구조와 세부 사항을 유지합니다. 전역 및 국소 판별자에 ParConv를 적용하여 전역적 구조와 국소 세부 정보를 동시에 보존합니다. 적대적 손실, 신원 일致성, 사이클 일치성, 스타일 제어를 통해 최신 기술 수준의 성능을 달성하여 생성된 카리커처의 현실감과 과장 정도를 크게 향상시킵니다.

ABSTRACT

Recently, image-to-image translation has been made much progress owing to the success of conditional Generative Adversarial Networks (cGANs). However, it's still very challenging for translation tasks with the requirement of high-level visual information conversion, such as photo-to-caricature translation that requires satire, exaggeration, lifelikeness and artistry. We present an approach for learning to translate faces in the wild from the source photo domain to the target caricature domain with different styles, which can also be used for other high-level image-to-image translation tasks. In order to capture global structure with local statistics while translation, we design a dual pathway model of cGAN with one global discriminator and one patch discriminator. Beyond standard convolution (Conv), we propose a new parallel convolution (ParConv) to construct Parallel Convolutional Neural Networks (ParCNNs) for both global and patch discriminators, which can combine the information from previous layer with the current layer. For generator, we provide three more extra losses in association with adversarial loss to constrain consistency for generated output itself and with the target. Also the style can be controlled by the input style info vector. Experiments on photo-to-caricature translation of faces in the wild show considerable performance gain of our proposed method over state-of-the-art translation methods as well as its potential real applications.

연구 동기 및 목표

  • 이미지 간 번역에서 고수준의 시각적 변환 도전 과제를 해결하며, 풍자, 과장, 예술적 스타일링이 필요한 사진에서 카리커처로의 번역을 구현합니다.
  • 기존의 cGAN이 카리커처 생성 과정에서 전역적 얼굴 구조와 국소적 얼굴 세부 정보를 동시에 포착하는 데 어려움을 겪는 한계를 극복합니다.
  • 생성자에 스타일 정보 벡터를 통합하여 다양한 카리커처 출력을 위한 제어 가능한 스타일링을 가능하게 합니다.
  • 적대적 손실 외에 추가적인 손실 함수를 도입하여 생성된 카리커처의 충실도와 일관성을 향상시킵니다.
  • 사진에서 카리커처 번역을 넘어서 다른 고수준 이미지 번역 작업에 적용 가능한 확장 가능한 프레임워크를 개발합니다.

제안 방법

  • 전역 판별자와 패치 기반 판별자를 갖춘 이중 경로 기반 cGAN 아키텍처를 제안하여 전역적 얼굴 레이아웃과 국소적 얼굴 텍스처 세부 정보를 동시에 포착합니다.
  • 이전 및 현재 레이어의 특징을 병렬 경로에서 조합함으로써 레이어 간 특징 융합을 가능하게 하는 새로운 컨볼루션 연산인 Parallel Convolution(ParConv)을 도입합니다.
  • 전역 및 패치 판별자 모두에 ParConv를 활용하여 ParCNNs(병렬 컨볼루션 신경망)를 구성함으로써 특징 표현 학습 능력을 향상시킵니다.
  • 적대적 손실 외에 신원 일치 손실, 사이클 일치 손실, 인지 손실을 통합하여 훈련 안정성과 출력 품질을 향상시킵니다.
  • 스태일 정보 벡터를 생성자의 조건부 입력으로 통합하여 출력 카리커처의 스타일 수준과 예술적 스타일 제어를 가능하게 합니다.
  • 제약 없는 얼굴 이미지(자연계)에서 종합적으로 훈련하여 다양한 신원, 자세, 조명 조건에 일반화할 수 있도록 합니다.

실험 결과

연구 질문

  • RQ1이중 경로 기반 cGAN 아키텍처는 사진에서 카리커처로의 번역에서 전역적 얼굴 구조 유지와 국소 세부 정보 과장 사이의 균형을 효과적으로 달성할 수 있는가?
  • RQ2고수준 이미지 번역 작업에서 표준 컨볼루션에 비해 제안된 ParConv 연산이 특징 표현에 얼마나 향상되는가?
  • RQ3추가적인 일치성 및 인지 손실은 생성된 카리커처의 현실감과 스타일링 품질에 어떤 영향을 미치는가?
  • RQ4학습 가능한 스타일 벡터의 통합을 통해 동일한 입력 사진에서 다양한 카리커처 스타일을 제어 가능한 방식으로 생성할 수 있는가?
  • RQ5제안된 방법은 제약 없는 실세계 얼굴 데이터셋에서 기존 최신 기술 수준의 이미지 간 번역 모델을 초월하는가?

주요 결과

  • 제안된 방법은 사진에서 카리커처로의 번역 벤치마크에서 최신 기술 수준의 이미지 간 번역 모델보다 뚜렷한 성능 향상을 달성합니다.
  • 이중 경로 판별자 설계는 구조적 충실도와 국소 세부 정보 과장 양면에서 향상되어 더욱 생생하고 예술적으로 표현력 있는 카리커처를 생성합니다.
  • ParConv 연산은 레이어 간 특징 융합을 가능하게 하여 얼굴 텍스처와 형태의 더 나은 표현을 기여합니다.
  • 적대적 손실에 신원 일치, 사이클 일치, 인지 손실을 조합함으로써 훈련이 더 안정화되고 출력 품질이 향상됩니다.
  • 다양한 스타일 벡터를 조건으로 삼아 동일한 입력 사진에서 다양한 카리커처 스타일을 성공적으로 생성함으로써 효과적인 스타일 제어 능력을 입증합니다.
  • 모델는 제약 없는 실세계 얼굴 이미지(자연계)에 대해 잘 일반화되어 자세, 조명, 표정 변화에 대해 강건함을 보입니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.