Skip to main content
QUICK REVIEW

[논문 리뷰] High-Quality Facial Photo-Sketch Synthesis Using Multi-Adversarial Networks

Lidan Wang, Vishwanath A. Sindagi|arXiv (Cornell University)|2017. 10. 27.
Generative Adversarial Networks and Image Synthesis참고 문헌 53인용 수 12
한 줄 요약

이 논문은 다중 적대적 GAN 프레임워크인 PS²-MAN을 제안하며, 다중 해상도 특징 맵에서 적대적 감독을 적용하여 고해상도 이미지를 생성함으로써 고품질의 얼굴 사진-스케치 합성에 기여한다. CycleGAN 기반의 구조에 사이클 일致성과 L1 재구성 손실을 통합함으로써, CUHK 및 CUFSF 데이터셋에서 이미지 품질과 얼굴 매칭 정확도 면에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Synthesizing face sketches from real photos and its inverse have many applications. However, photo/sketch synthesis remains a challenging problem due to the fact that photo and sketch have different characteristics. In this work, we consider this task as an image-to-image translation problem and explore the recently popular generative models (GANs) to generate high-quality realistic photos from sketches and sketches from photos. Recent GAN-based methods have shown promising results on image-to-image translation problems and photo-to-sketch synthesis in particular, however, they are known to have limited abilities in generating high-resolution realistic images. To this end, we propose a novel synthesis framework called Photo-Sketch Synthesis using Multi-Adversarial Networks, (PS2-MAN) that iteratively generates low resolution to high resolution images in an adversarial way. The hidden layers of the generator are supervised to first generate lower resolution images followed by implicit refinement in the network to generate higher resolution images. Furthermore, since photo-sketch synthesis is a coupled/paired translation problem, we leverage the pair information using CycleGAN framework. Both Image Quality Assessment (IQA) and Photo-Sketch Matching experiments are conducted to demonstrate the superior performance of our framework in comparison to existing state-of-the-art solutions. Code available at: https://github.com/lidan1/PhotoSketchMAN.

연구 동기 및 목표

  • 사진과 스케치 모odal 간의 도메인 갭으로 인해 어려운, 고해상도이고 현실적인 얼굴 스케치를 사진에서 생성하고 그 반대로도 생성하는 문제를 해결하기 위해.
  • 특히 고해상도에서의 아티팩트와 낮은 현실감을 보이는 기존의 GAN 기반 사진-스케치 합성 방법을 개선하기 위해.
  • 하류 매칭 작업을 위한 얼굴 인식 성능을 향상시키기 위해 사진-스케치 합성 품질을 향상시키기 위해.
  • 쌍체 데이터와 사이클 일치 학습을 활용하여 번역 과정에서 신원 유지 보장을 확보하기 위해.
  • 각 수준에서 적대적 감독을 적용하여 저해상도에서 고해상도로 점진적으로 특징을 정교화하는 다단계 생성 프레임워크를 개발하기 위해.

제안 방법

  • 프레임워크는 두 개의 생성자 $G_A$ (사진 → 스케치)와 $G_B$ (스케치 → 사진)를 포함하며, 쌍체가 아닌 이미지 간 번역을 가능하게 하기 위해 CycleGAN 프레임워크 내에서 훈련된다.
  • 생성자의 다중 디컨볼루션 레이어에 적대적 감독을 적용함으로써, 저해상도에서 고해상도 특징 맵으로 점진적인 정교화가 가능해진다.
  • 다중 판별자 아키텍처를 사용하여, 각 판별자는 특정 해상도 수준에서 생성된 이미지의 현실감을 평가함으로써, 정밀도를 향상시키고 아티팩트를 감소시킨다.
  • 훈련 목표는 사이클 일치 손실과 L1 재구성 손실을 결합하여 생성자를 정규화하고 신원 및 구조적 세부 정보를 유지한다.
  • 생성자 아키텍처는 스트라이드 컨볼루션과 트랜스포지드 컨볼루션을 사용한 인코더-디코더 스타일이며, 공간적 세부 정보를 유지하기 위해 스킵 연결을 포함한다.
  • 적대적, 사이클 일치, L1 손실의 조합을 통해 엔드 투 엔드로 훈련되어 현실적이며 고해상도의 출력을 보장한다.

실험 결과

연구 질문

  • RQ1다양한 해상도 수준에서 다중 적대적 훈련이 사진-스케치 합성의 현실감을 향상시키고 아티팩트를 감소시키는가?
  • RQ2CycleGAN 프레임워크 내에서 L1 재구성 손실과 사이클 일치 손실을 통합함으로써 신원 유지 및 합성 품질이 향상되는가?
  • RQ3제안된 다단계 적대적 생성자와 단일 단계 GAN은 고해상도 얼굴 이미지를 생성하는 데 어떻게 비교되는가?
  • RQ4PS²-MAN 프레임워크는 합성된 사진이나 스케치를 사용할 때 얼굴 인식 성능을 어느 정도 향상시키는가?
  • RQ5이 방법은 과도하게 과장된 경찰 스케치를 포함한 다양한 스케치 스타일로 일반화 가능한가?

주요 결과

  • CUHK 데이터셋에서 PS²-MAN은 랭크-1 사진 매칭 정확도 100%와 스케치 매칭 정확도 99%를 기록하여 모든 베이스라인을 압도했다.
  • 더 도전적인 CUFSF 데이터셋에서 PS²-MAN은 랭크-1 사진 매칭 정확도 47%와 스케치 매칭 정확도 51%를 기록했으며, Pix2Pix(37% 및 40%)와 CycleGAN(25% 및 44%)를 크게 앞섰다.
  • SSIM 및 FSIM 메트릭에서 PS²-MAN은 사진 및 스케치 합성 모두에서 최고 점수를 기록했으며, SSIM은 각각 0.7915와 0.6156, FSIM은 각각 0.8062와 0.7361이었다.
  • 시각적 비교에서 PS²-MAN은 Pix2Pix, CycleGAN, DualGAN과 비교해 얼굴 기능 주변의 아티팩트를 최소화했으며, 특히 뚜렷한 왜곡을 유발하지 않았다.
  • 제거 실험을 통해 다중 해상도 수준에서의 다중 적대적 감독이 이미지 품질 향상과 아티팩트 감소에 크게 기여하는 것으로 확인되었다.
  • 사이클 일치 손실과 L1 재구성 손실의 조합은 효과적인 정규화를 제공하여 더 나은 신원 유지 및 더 높은 합성 정밀도를 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.