[논문 리뷰] Deep Generation of Face Images from Sketches
이 논문은 특징 공간 내에서 얼굴 구성 요소(눈, 코, 입)의 은닉된 다양체를 모델링함으로써, 원시적 또는 불완전한 수작업 스케치에서 고해상도의 현실적인 얼굴 이미지를 생성하는 딥러닝 프레임워크인 DeepFaceDrawing을 제안한다. 로컬에서 글로벌로의 접근 방식을 통해 구성 요소 임bedding, 특징 매핑, 이미지 합성 모듈을 활용함으로써, 스케치를 연속적인 제약 조건으로 간주함으로써 저품질 입력에도 불구하고 사용자 의도를 유지하고 세밀한 제어를 가능하게 하여 강력한 합성 성능을 달성한다.
Recent deep image-to-image translation techniques allow fast generation of face images from freehand sketches. However, existing solutions tend to overfit to sketches, thus requiring professional sketches or even edge maps as input. To address this issue, our key idea is to implicitly model the shape space of plausible face images and synthesize a face image in this space to approximate an input sketch. We take a local-to-global approach. We first learn feature embeddings of key face components, and push corresponding parts of input sketches towards underlying component manifolds defined by the feature vectors of face component samples. We also propose another deep neural network to learn the mapping from the embedded component features to realistic images with multi-channel feature maps as intermediate results to improve the information flow. Our method essentially uses input sketches as soft constraints and is thus able to produce high-quality face images even from rough and/or incomplete sketches. Our tool is easy to use even for non-artists, while still supporting fine-grained control of shape details. Both qualitative and quantitative evaluations show the superior generation ability of our system to existing and alternative solutions. The usability and expressiveness of our system are confirmed by a user study.
연구 동기 및 목표
- 기존의 스케치에서 이미지로의 변환 모델들이 현실적인 얼굴 생성을 위해 고품질 또는 윤곽선 유사 스케치를 요구하는 한계를 해결하기 위해.
- 높은 수준의 기술이 요구되지 않는 원시적, 불완전하거나 낮은 수준의 수작업 스케치로부터 고품질의 얼굴 이미지를 합성할 수 있도록 하기 위해.
- 특징 공간 내에서 저차원 다양체를 통해 타당한 얼굴 구성 요소 형태를 은닉적으로 모델링하여 강건성과 사용자 友보를 향상시키기 위해.
- 전체 얼굴의 일관성을 유지하면서도 얼굴 구성 요소의 형태에 대해 세밀한 제어를 가능하게 하기 위해.
- 사용자 연구와 실세계 응용(예: 얼굴 모핑 및 복사-붙여넣기)을 통해 사용성과 표현력 평가를 수행하기 위해.
제안 방법
- 시스템은 입력 스케치를 다섯 개의 구성 요소로 분해한다: 왼쪽 눈, 오른쪽 눈, 코, 입, 나머지 영역으로, 각각을 별도로 처리한다.
- 구성 요소 임bedding(CE) 모듈은 오토인코더를 사용하여 특징 기술자(특징 기술자)를 학습하고 스케치 구성 요소를 잠재 공간 내의 구성 요소 다양체에 투영한다.
- 특징 매핑(FM) 모듈은 임베딩된 구성 요소 특징을 32채널 특징 맵으로 매핑하여 정보 흐름을 향상시키고 공간적 융합을 가능하게 한다.
- 이미지 합성(IS) 모듈은 융합된 특징 맵에서 조건부 GAN 유사 아키텍처를 사용하여 최종 512×512 해상도의 얼굴 이미지를 생성한다.
- 그림자 유도 인터페이스는 스케치 구성 요소를 구성 요소 다양체에 투영함으로써 사용자가 더 쉽게 스케치할 수 있도록 도와주며, 구조적 가이드를 제공한다.
- 프레임워크는 입력 스케치를 연속적인 제약 조건으로 간주하여, 불완전하거나 정확하지 않은 선으로 그린 스케치일지라도 사용자 의도를 충실하게 재현할 수 있도록 한다.
실험 결과
연구 질문
- RQ1딥러닝 모델이 전문가 수준의 입력이 아닌 원시적 또는 불완전한 수작업 스케치로부터 현실적인 얼굴 이미지를 생성할 수 있는가?
- RQ2구성 요소 수준의 특징 다양체를 어떻게 은닉적으로 모델링할 수 있는가? 이는 스케치 품질에 대한 강건성을 향상시킬 수 있는가?
- RQ3로컬에서 글로벌로의 접근 방식과 구성 요소별 정밀 조정이 합성 품질과 사용자 제어를 얼마나 향상시킬 수 있는가?
- RQ4시스템은 국소적 편집을 허용하면서도 전체 얼굴의 일관성을 어떻게 유지하는가?
- RQ5제안된 방법이 정량적 및 정성적 평가 모두에서 기존의 스케치에서 이미지로의 변환 모델을 능가할 수 있는가?
주요 결과
- 제안된 방법은 원시적 또는 불완전한 스케치로부터도 고해상도의 현실적인 얼굴 이미지(512×512 해상도)를 생성하며, 시각적 품질에서 기존 방법들을 능가한다.
- 사용자 연구를 통해 시스템의 사용성과 표현력이 확인되었으며, 예술적 기술이 없는 사용자도 낮은 그림 실력으로도 타당한 얼굴 이미지를 생성할 수 있음을 입증했다.
- 시스템은 스케치를 경계 조건이 아닌 연속적인 제약 조건으로 간주함으로써, 사용자 의도를 충실하게 유지하며 스케치의 완성도에 관계없이 강건성을 확보한다.
- 정량적 및 정성적 평가를 통해 기준 모델 및 다른 스케치에서 이미지로의 변환 모델 대비 뛰어난 성능을 입증했다.
- 시스템은 국소적 편집과 얼굴 구성 요소 형태에 대한 세밀한 제어를 지원하여 얼굴 모핑 및 복사-붙여넣기 등의 응용을 가능하게 한다.
- 레이아웃 오류나 색상 제어에 대한 제한이 있음에도 불구하고, 구조적 사전 지식이 있는 다른 객체 카테고리로의 응용 가능성은 매우 높다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.