[논문 리뷰] DeepFacePencil: Creating Face Images from Freehand Sketches
이 논문은 수작업 스케치에서 사진처럼 생긴 얼굴 이미지를 생성하기 위해 이중 생성기와 공간 주의 풀링(SAP) 모듈을 갖춘 조건부 생성 적대 신경망인 DeepFacePencil을 제안한다. 모델은 공간적 위치에 따라 현실성과 스케치 일치성의 균형을 적응적으로 조정함으로써 다양한 스케치 스타일, 특히 잘못 그린 또는 기형적인 스트로크를 포함한 경우에도 강건하게 일반화되며, 합성된 스케치와 실제 수작업 스케치 모두에서 기존 방법들보다 영상 품질과 강건성 측면에서 뛰어난 성능을 보인다.
In this paper, we explore the task of generating photo-realistic face images from hand-drawn sketches. Existing image-to-image translation methods require a large-scale dataset of paired sketches and images for supervision. They typically utilize synthesized edge maps of face images as training data. However, these synthesized edge maps strictly align with the edges of the corresponding face images, which limit their generalization ability to real hand-drawn sketches with vast stroke diversity. To address this problem, we propose DeepFacePencil, an effective tool that is able to generate photo-realistic face images from hand-drawn sketches, based on a novel dual generator image translation network during training. A novel spatial attention pooling (SAP) is designed to adaptively handle stroke distortions which are spatially varying to support various stroke styles and different levels of details. We conduct extensive experiments and the results demonstrate the superiority of our model over existing methods on both image quality and model generalization to hand-drawn sketches.
연구 동기 및 목표
- 다양한 스트로크 스타일과 결함이 있는 수작업 스케치로부터 고품질의 사진처럼 생긴 얼굴 이미지를 생성하는 데 도전하는 것.
- 기존의 엣지가 정렬된 합성 스케치로 훈련된 이미지 간 번역 모델은 실제 수작업 스케치에서 스트로크 왜곡이 발생할 경우 일반화에 실패한다는 한계를 극복하는 것.
- 스트로크 품질에 따라 스케치의 다양한 영역에서 영상의 현실성과 스케치 일치성 간의 균형을 적응적으로 조절하는 방법을 개발하는 것.
- 훈련 데이터에 기형된 스케치를 통합하고 공간적으로 변동하는 왜곡을 처리하기 위해 학습 가능한 주의 메커니즘을 사용하여 모델의 일반화 능력을 향상시키는 것.
제안 방법
- 특징 학습과 강건성을 향상시키기 위해 두 개의 생성기를 동시에 훈련시키는 이중 생성기 훈련 전략을 사용한다.
- 다양한 커널 크기를 가진 다중 풀링 연산을 적용하여 스트로크 정렬을 완화시키기 위해 새로운 공간 주의 풀링(SAP) 모듈을 도입한다. 이는 다수의 완화된 스케치 표현을 생성한다.
- SAP 모듈은 지역적 스트로크 품질과 왜곡에 따라 중요도를 동적으로 할당하는 학습 가능한 공간 주의 레이어를 통해 다수의 완화된 스케치를 융합한다.
- 주의 가중치는 각 공간 위치별로 계산되어 잘못 그린 영역에서는 현실성을 우선시하고 잘 그린 영역에서는 일치성을 우선시한다.
- 사진처럼 생긴 현실성과 구조 일관성을 확보하기 위해 적대적, 인지적, 정체성 손실 성분을 포함한 조건부 GAN 프레임워크를 사용하여 모델을 훈련시킨다.
- 훈련 중에 다양한 스트로크 오프셋을 가진 기형된 스케치를 합성하여 실제 그림의 변형에 대한 강건성을 향상시킨다.
실험 결과
연구 질문
- RQ1딥 러닝 모델은 다양한 스트로크 스타일을 가진 수작업 스케치에서 높은 정밀도와 다양한 스트로크 스타일에 대한 일반화 능력을 갖춘 사진처럼 생긴 얼굴 이미지를 생성할 수 있는가?
- RQ2입력 스케치에 일관되지 않거나 기형적인 스트로크가 포함되어 있을 경우, 모델은 영상의 현실성과 스케치 일치성 간의 균형을 어떻게 조절할 수 있는가?
- RQ3합성 엣지 맵으로 훈련된 모델이 불규칙한 스트로크 패턴을 가진 실제 수작업 스케치로 일반화될 수 있는 정도는 어느 정도인가?
- RQ4공간적으로 적응적인 주의 메커니즘의 통합이 저품질 또는 기형된 스케치에서 성능 향상에 기여하는가?
주요 결과
- 제안된 DeepFacePencil 모델은 FID 및 LPIPS 메트릭을 통해 합성 스케치와 실제 수작업 스케치 모두에서 기준 모델들보다 영상 품질 측면에서 뚜렷이 뛰어난 성능을 보였다.
- 전문가가 그린 스케치에서, 기준 모델들이 기형된 스케치로 미세조정된 경우조차도, 모델은 더 사실적인 질감과 손상되지 않은 얼굴 구조를 생성하였다.
- 마우스로 그린 일반 사용자 스케치에서, 모델은 최소한의 잡음으로 높은 시각적 품질을 유지하였고, 기준 모델들은 흐릿하고 기형된 결과를 생성하였다.
- 모델은 큰 스트로크 기형(최대 d=30)에도 효과적으로 일반화되어 잡음 없이 사실적인 이미지를 생성하였고, 반면 기준 모델들은 얼굴 기관에서 심각한 왜곡을 보였다.
- 공간 주의 풀링(SAP) 모듈은 현실성과 일치성 간의 적응적 균형 조절을 가능하게 하였으며, 신뢰할 수 있는 스케치 영역에는 높은 주의를 기울이고, 모호하거나 기형된 영역에는 더 많은 정규화를 적용하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.