Skip to main content
QUICK REVIEW

[논문 리뷰] MagGAN: High-Resolution Face Attribute Editing with Mask-Guided Generative Adversarial Network

Yi Wei, Zhe Gan|arXiv (Cornell University)|2020. 10. 03.
Face recognition and analysis참고 문헌 45인용 수 6
한 줄 요약

MagGAN은 사전 훈련된 파서에서 유도한 의미적 얼굴 마스크를 사용하여 정밀하고 국소적인 편집을 가능하게 하는 마스크 유도 생성 적대 신경망을 소개한다. 이는 속성과 무관한 영역(예: 모자, 목도어)을 유지하면서 고해상도(1024×1024) 얼굴 속성 편집을 수행한다. 마스크 유도 재구성 손실, 새로운 마스크 유도 조건화 전략, 다중 수준 피처 기반 판별기 등을 통해 기존 방법에 비해 크게 뛰어난 이미지 품질과 편집 정확도를 달성한다.

ABSTRACT

We present Mask-guided Generative Adversarial Network (MagGAN) for high-resolution face attribute editing, in which semantic facial masks from a pre-trained face parser are used to guide the fine-grained image editing process. With the introduction of a mask-guided reconstruction loss, MagGAN learns to only edit the facial parts that are relevant to the desired attribute changes, while preserving the attribute-irrelevant regions (e.g., hat, scarf for modification `To Bald'). Further, a novel mask-guided conditioning strategy is introduced to incorporate the influence region of each attribute change into the generator. In addition, a multi-level patch-wise discriminator structure is proposed to scale our model for high-resolution ($1024 imes 1024$) face editing. Experiments on the CelebA benchmark show that the proposed method significantly outperforms prior state-of-the-art approaches in terms of both image quality and editing performance.

연구 동기 및 목표

  • 비정확한 국소화 문제를 해결하기 위해, 허브나 목도어와 같은 관련 없는 영역이 의도치 않게 수정되는 것을 방지한다.
  • 기존 연구에서 다루지 않은 바와 같이 고해상도(1024×1024) 얼굴 속성 편집을 가능하게 한다.
  • 편집 중에 속성과 관련된 영역만 유도하기 위해 의미적 얼굴 마스크를 활용하여 편집 충실도를 향상시킨다.
  • 각 속성 변경에 대해 공간적으로 영향을 미치는 영역을 명시적으로 모델링하는 조건화 메커니즘을 개발한다.
  • 다중 수준 피처 기반 판별기를 사용하여 훈련을 안정화하고 고해상도 생성에서 현실감을 향상시킨다.

제안 방법

  • 사전 훈련된 얼굴 파서로 식별된 속성과 관련된 얼굴 영역에만 편집이 제한되는 마스크 유도 재구성 손실을 도입하여, 모자나 목도어와 같은 속성과 무관한 영역을 유지한다.
  • 각 속성 변경에 대해 공간적으로 정렬된 영향 영역을 학습하는 새로운 마스크 유도 조건화 전략을 제안하여, 속성 편집과 대상 얼굴 부위 간의 정렬도를 향상시킨다.
  • 粗기에서 세밀한 수준까지의 수신장 영역을 가진 다중 수준 피처 기반 판별기를 사용하여 훈련 안정성과 1024×1024 이미지 생성의 현실감을 향상시킨다.
  • 속성과 얼굴 구성 요소 간의 의미적 관계를 인코딩하기 위해 사전 정의된 속성-얼굴 부위 관계 행렬(AR⁺, AR⁻)을 활용하여 재구성과 조건화에 유도한다.
  • 에ncoder-디코더 아키텍처와 차이 속성 벡터 입력을 갖는 STGAN의 아키텍처를 기반으로 하되, 마스크 기반 감독과 공간 조건화를 추가하여 확장한다.
  • 사전 훈련된 얼굴 파서를 활용하여 부드러운 세그먼테이션 마스크를 생성하여 미세한 편집을 위한 기하학적 및 의미적 제약 조건을 제공한다.

실험 결과

연구 질문

  • RQ1의미적 얼굴 마스크가 속성과 관련된 영역에만 편집을 제한함으로써 얼굴 속성 편집의 국소화 정확도를 향상시킬 수 있는가?
  • RQ2어떤 방식으로 속성 변경 정보를 공간적으로 인지하는 표현에 조건화하여 관련 없는 영역의 의도하지 않은 수정을 방지할 수 있는가?
  • RQ3어떤 아키텍처 설계가 1024×1024 얼굴 속성 편집을 위한 안정적이고 고품질의 훈련을 가능하게 하는가?
  • RQ4표준 GAN 기반 방법에 비해 마스크 유도 감독이 이미지 품질과 편집 일관성에 얼마나 기여하는가?
  • RQ5모델은 다양한 속성 편집에 대해 정체성과 배경 세부 정보를 유지하면서 일반화할 수 있는가?

주요 결과

  • 사용자 연구를 통해 MagGAN은 STGAN과 같은 기존 최고 수준의 방법보다 CelebA 벤치마크에서 이미지 품질과 편집 성능 모두에서 뚜렷한 우월성을 보였다.
  • 사용자 연구 결과, STGAN이 더 눈에 띄는 편집을 생성하더라도 MagGAN이 더 선호되는데, 이는 MagGAN이 모자나 목도어와 같은 속성과 무관한 영역을 수정하지 않기 때문이다.
  • 마스크 유도 재구성 손실은 편집 대상이 아닌 영역을 효과적으로 유지하여, 모자나 목도어와 같은 영역에서의 아티팩트를 감소시켰다.
  • 다중 수준 피처 기반 판별기는 1024×1024 해상도에서 안정적인 훈련과 고해상도 생성을 가능하게 하였으며, 모발과 피부의 세밀한 디테일이 잘 유지되었다.
  • 정량적 평가 결과, 속성 변경이 없는 경우 원본 입력에 대한 복원도가 높은 PSNR 및 SSIM 값이 관측되어, 더 높은 복원 정확도를 나타냈다.
  • 속성-얼굴 부위 관계 행렬(AR⁺, AR⁻)은 속성 변경을 특정 얼굴 구성 요소에 정확하게 매핑할 수 있게 하여 편집 정밀도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.