Skip to main content
QUICK REVIEW

[논문 리뷰] Expanding the Latent Space of StyleGAN for Real Face Editing

Yu Yin, Ghasedi Kamran|arXiv (Cornell University)|2022. 04. 26.
Face recognition and analysis인용 수 6
한 줄 요약

이 논문은 실사 얼굴 편집에서 정체성 유지와 분리된 속성 조작 간의 상충 관계를 해소하기 위해 StyleGAN의 이중 분지 잠재 공간 확장을 제안한다. 희소 스타일 편집과 정렬 정규화를 갖춘 2D 콘텐츠 특징 융합을 통해, 최소한의 왜곡으로 상태 최고 수준의 재구성 및 편집 품질을 달성하고, 속성의 분리도 향상시킨다.

ABSTRACT

Recently, a surge of face editing techniques have been proposed to employ the pretrained StyleGAN for semantic manipulation. To successfully edit a real image, one must first convert the input image into StyleGAN's latent variables. However, it is still challenging to find latent variables, which have the capacity for preserving the appearance of the input subject (e.g., identity, lighting, hairstyles) as well as enabling meaningful manipulations. In this paper, we present a method to expand the latent space of StyleGAN with additional content features to break down the trade-off between low-distortion and high-editability. Specifically, we proposed a two-branch model, where the style branch first tackles the entanglement issue by the sparse manipulation of latent codes, and the content branch then mitigates the distortion issue by leveraging the content and appearance details from the input image. We confirm the effectiveness of our method using extensive qualitative and quantitative experiments on real face editing and reconstruction tasks.

연구 동기 및 목표

  • 사전 학습된 StyleGAN을 사용한 실사 이미지 편집에서 낮은 왜곡 재구성과 높은 편집 가능성 간의 상충 관계를 해결한다.
  • 의미적 편집 중 정체성과 외관 세부 사항을 유지하는 데 어려움을 겪는 기존의 복원 방법의 한계를 극복한다.
  • 스타일 코드 조작에 희소성 제약 조건을 도입하여 분리된 국소적 속성 편집을 가능하게 한다.
  • 입력 이미지의 2D 콘텐츠 특징을 합성 파이프라인에 융합하여 편집 왜곡을 줄인다.
  • 기존의 PTI와 달리 생성기의 미세조정 없이도 새로운 실사 얼굴에서 정체성 유지 편집을 가능하게 한다.

제안 방법

  • 이중 분지 모델을 제안한다: 1D 스타일 코드에 대한 희소성 정규화를 통해 분리된 편집을 위한 스타일 분지와, 2D 콘텐츠 특징을 사용해 왜곡을 줄이기 위한 콘텐츠 분지.
  • 스파arsity 정규화($/mathcal{L}_{spa}$)를 적용하여 활성 스타일 코드 차원의 수를 제한함으로써 국소적이고 분리된 속성 편집을 가능하게 한다.
  • 입력 이미지에서 추출한 2D 콘텐츠 특징을 합성 경로에 통합하여 편집을 정교화하고 조명, 표정, 헤어 스타일과 같은 이미지 고유의 세부 사항을 유지한다.
  • 소스 이미지와 생성된 이미지 간의 특징 정렬을 감독하기 위해 정렬 손실($/mathcal{L}_{align}$)을 사용하여 편집되지 않은 영역이 그대로 유지되도록 보장한다.
  • 전역적 의미 제어와 국소적 질감 충실도를 조합하기 위해, 특징 융합 모듈을 사용해 다중 레이어에서 스타일 및 콘텐츠 특징을 융합한다.
  • 재구성, 희소성, 정렬, 지각적 손실의 조합으로 종합적으로 훈련하여 품질과 편집 가능성 양쪽을 최적화한다.

실험 결과

연구 질문

  • RQ1단일 효율적인 추론 파이프라인을 통해 실사 얼굴 이미지 편집에서 낮은 왜곡 재구성과 높은 편집 가능성을 동시에 달성할 수 있는가?
  • RQ2스타일 코드 조작에 대한 희소성 정규화가 속성 분리도와 정체성 또는 외관의 뜻하지 않은 변화에 어떤 영향을 미치는가?
  • RQ3기존의 잠재 공간 복원 방식에 비해 입력 이미지의 2D 콘텐츠 특징이 편집 정확도 향상과 왜곡 감소에 얼마나 기여하는가?
  • RQ4정렬 정규화가 속성 편집 중에 비편집 영역(예: 배경, 표정)을 효과적으로 유지하는 데 기여하는가?
  • RQ5추가적인 콘텐츠 특징을 통해 잠재 공간을 확장하면 기존의 $/mathcal{W}$ 또는 $/mathcal{W+}$ 공간 복원 방식보다 성능 향상이 이루어지는가?

주요 결과

  • 아블레이션 연구에서 제안된 방법은 정체성 유사도(ID)가 0.77로 가장 높았으며, 기준 설정보다 유의미하게 뛰어나다.
  • 희소성 정규화와 정렬 손실을 함께 적용했을 때, L2 재구성 오차는 0.028, LPIPS는 0.09로 감소하여 뛰어난 이미지 충실도를 보였다.
  • 희소성 정규화 덕분에 분리된 편집이 가능해졌으며, '안경'을 편집할 경우 얼굴 색상이나 헤어 스타일이 변화하지 않아 뜻하지 않은 속성 변화가 감소했다.
  • 콘텐츠 정밀화 분지가 왜곡을 줄였음을 보여주었으며, pSp와 e4e에 비해 더 선명한 윤곽과 더 세밀한 세부 사항(예: 주름, 헤어)이 생성된 이미지에서 관찰되었다.
  • 정량적 결과는 재구성 작업에서 LPIPS, L2, PSNR, SSIM 모든 지표에서 최신 기술을 능가하는 성능을 보였다.
  • 아블레이션 연구에서 정렬 손실을 제거할 경우 색상 정확도가 떨어지는 것으로 확인되어, 외관 세부 사항 유지에 있어 그 핵심적인 역할을 한다는 점이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.