Skip to main content
QUICK REVIEW

[논문 리뷰] FacialGAN: Style Transfer and Attribute Manipulation on Synthetic Faces

Ricard Durall, Jireh Jam|arXiv (Cornell University)|2021. 10. 18.
Face recognition and analysis인용 수 8
한 줄 요약

FacialGAN은 분할 마스크를 활용하여 미세 조절 가능한 제어와 다중 목적 최적화를 통해 합성 얼굴에 대해 동시에 스타일 전이와 상호작용 가능한 얼굴 속성 조작을 위한 통합 프레임워크를 제안한다. 이는 신뢰도 높은 결과를 얻기 위해 고해상도 성능을 달성하며, 정체성 유지(89.8% 정확도) 및 속성 전이에서 기존 방법을 능가한다.

ABSTRACT

Facial image manipulation is a generation task where the output face is shifted towards an intended target direction in terms of facial attribute and styles. Recent works have achieved great success in various editing techniques such as style transfer and attribute translation. However, current approaches are either focusing on pure style transfer, or on the translation of predefined sets of attributes with restricted interactivity. To address this issue, we propose FacialGAN, a novel framework enabling simultaneous rich style transfers and interactive facial attributes manipulation. While preserving the identity of a source image, we transfer the diverse styles of a target image to the source image. We then incorporate the geometry information of a segmentation mask to provide a fine-grained manipulation of facial attributes. Finally, a multi-objective learning strategy is introduced to optimize the loss of each specific tasks. Experiments on the CelebA-HQ dataset, with CelebAMask-HQ as semantic mask labels, show our model's capacity in producing visually compelling results in style transfer, attribute manipulation, diversity and face verification. For reproducibility, we provide an interactive open-source tool to perform facial manipulations, and the Pytorch implementation of the model.

연구 동기 및 목표

  • 기존 방법이 스타일 전이 또는 속성 번역에만 집중하여 상호작용성과 미세 조절 능력이 부족한 점을 해결한다.
  • 원본 정체성을 유지하면서 동시에 고품질의 스타일 전이와 픽셀 수준의 속성 조작을 가능하게 한다.
  • 분할 마스크를 기하학적 가이던스로 통합하여 이전 모델의 확장성 및 현실성 문제를 해결한다.
  • 연구 및 산업 현장에서의 재현 가능성과 실용적 적용성을 높이기 위해 사용자 友好的한 실시간 얼굴 조작 도구를 제공한다.

제안 방법

  • 기본 이미지에서 다양한 스타일을 소스 이미지로 전이하면서도 정체성을 유지하기 위해 스타일 인코더와 콘텐츠 인식 생성기를 통합한다.
  • 얼굴 속성(예: 눈, 코, 입)의 미세 조절 가능하고 국소적인 조작을 위해 분할 마스크를 기하학적 가이던스 신호로 사용한다.
  • 대부분의 손실 함수를 조합하여 적대적 손실, 정체성 유지 손실, 속성 일관성 손실, 분할 마스크 일관성 손실을 포함한다.
  • 생성된 얼굴가 항상 사실적으로 유지되도록, 생성기의 훈련에 현실성 강화를 위한 디스크림네이터를 적용한다.
  • 훈련 중 지도를 제공하기 위해 사전 훈련된 분할 모델(CelebAMask-HQ)을 활용하여 정확한 파싱 맵을 생성한다.
  • 사용자가 실시간으로 분할 마스크를 수정할 수 있도록 허용하여, 모델이 해당에 대응하는 사실적인 얼굴 이미지를 생성하도록 한다.

실험 결과

연구 질문

  • RQ1통합 생성 프레임워크는 합성 얼굴에 대해 고해상도 스타일 전이와 미세 조절 가능한 상호작용 속성 조작을 동시에 달성할 수 있는가?
  • RQ2전반적인 속성 번역과 비교해 분할 마스크 가이던스가 얼굴 속성 편집의 정밀도와 다양성을 어떻게 향상시키는가?
  • RQ3특히 기하학적 변화가 큰 속성 조작이 포함된 경우, 스타일 전이와 속성 조작을 병행할 때 정체성을 얼마나 잘 유지할 수 있는가?
  • RQ4다중 목적 훈련 전략은 스타일 전이, 정체성 유지, 마스크 일관성 등의 상충되는 목표를 어떻게 균형 있게 조절하여 고품질 출력을 생성하는가?
  • RQ5분할 마스크에 비현실적이거나 일관되지 않은 구조가 포함된 경우, 모델의 실패 모드는 어떠한가?

주요 결과

  • FacialGAN은 스타일 전이와 속성 조작을 동시에 적용할 경우 89.8%의 얼굴 인식 정확도를 달성하여, 유사 조건에서 성능이 떨어지는 기준 모델들을 능가한다.
  • 남성 속성 전이 정확도는 100%를 기록했으며, 미소 속성 전이 정확도는 81.4%로, 이는 이전 방법인 MaskGAN(77.3%)과 SPADE(73.8%)를 크게 능가한다.
  • 입력 마스크와 예측된 파싱 결과 간 픽셀 수준의 분할 일관성은 모든 속성에서 96.40%를 기록했으며, 개별 속성 정확도는 눈(98.39%), 코(99.30%), 입(98.78%)이다.
  • 눈 또는 눈썹을 크게 확대하는 등의 극단적인 마스크 수정 조건에서도 사실적인 얼굴을 성공적으로 생성하여, 대규모 기하학적 변화에 대한 강건성을 입증했다.
  • qualitative 결과를 통해 일관된 얼굴 구조와 자연스러운 속성 전환을 보여주어, 높은 시각적 품질과 현실성을 유지함을 확인했다.
  • 마스크에 존재하지 않는 눈 등의 비현실적인 구성이 포함된 경우, 디스크림네이터 제약로 인해 모델이 마스크 입력을 무시하기 시작하는 한계가 드러났으며, 이는 현실성과 편집 자유도 사이의 상충 관계를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.