Skip to main content
QUICK REVIEW

[논문 리뷰] Only a Matter of Style: Age Transformation Using a Style-Based Regression Model

Yuval Alaluf, Or Patashnik|arXiv (Cornell University)|2021. 02. 04.
Generative Adversarial Networks and Image Synthesis참고 문헌 35인용 수 15
한 줄 요약

이 논문은 사전 훈련된 StyleGAN2의 잠재 공간에 진짜 입력을 인코딩함으로써 스타일 기반 회귀 모델과 사전 훈련된 연령 회귀 모델에 의해 안내되는 방식으로, 얼굴 이미지의 미세 조절 가능하고 연속적인 연령 변환을 가능하게 하는 SAM(스타일 기반 연령 조작)을 제안한다. 이 방법은 비선형적이고 분리된 잠재 경로를 학습하여 고해상도의 신원 유지 연령 변화를 가능하게 하며, 정량적·정성적 평가에서 이전 방법들을 능가한다.

ABSTRACT

The task of age transformation illustrates the change of an individual's appearance over time. Accurately modeling this complex transformation over an input facial image is extremely challenging as it requires making convincing, possibly large changes to facial features and head shape, while still preserving the input identity. In this work, we present an image-to-image translation method that learns to directly encode real facial images into the latent space of a pre-trained unconditional GAN (e.g., StyleGAN) subject to a given aging shift. We employ a pre-trained age regression network to explicitly guide the encoder in generating the latent codes corresponding to the desired age. In this formulation, our method approaches the continuous aging process as a regression task between the input age and desired target age, providing fine-grained control over the generated image. Moreover, unlike approaches that operate solely in the latent space using a prior on the path controlling age, our method learns a more disentangled, non-linear path. Finally, we demonstrate that the end-to-end nature of our approach, coupled with the rich semantic latent space of StyleGAN, allows for further editing of the generated images. Qualitative and quantitative evaluations show the advantages of our method compared to state-of-the-art approaches.

연구 동기 및 목표

  • 실제적인 연속적인 연령 변환을 가능하게 하면서도 신원을 유지하는 문제를 해결하기 위해.
  • 이전 방법들이 이산적인 연령 그룹에 의존하거나 GAN 공간 내에서 선형적이고 뒤섞인 잠재 경로를 가정하는 데서 비롯되는 한계를 극복하기 위해.
  • 사전 훈련된 연령 회귀 모델을 사용하여 노화를 회귀 문제로 공식화함으로써 연령 진행에 대한 정교한 제어를 가능하게 하기 위해.
  • StyleGAN의 W+ 공간에서 연령과 털 색깔, 얼굴 특징 등의 다른 특성들과 분리된 비선형적이고 분리된 잠재 경로를 학습하기 위해.
  • StyleGAN 잠재 공간의 풍부한 의미적 구조를 활용하여 생성된 노화 결과에 추가 편집 기능을 제공하기 위해.

제안 방법

  • 사전 훈련된 StyleGAN2 생성자로 고품질의 이미지를 생성하며, 학습된 인코더가 입력 얼굴 이미지를 W+ 잠재 공간으로 매핑한다.
  • 훈련 중에 보조적인 사전 훈련된 연령 회귀 네트워크가 지도 역할을 하여, 인코더가 원하는 목표 연령에 해당하는 잠재 코드를 생성하도록 이끈다.
  • 신원 유지( ArcFace를 통한), 연령 회귀 손실(VGG 기반), 그리고 지각 손실(VGG 특징)을 조합한 다중 손실 목적함수를 사용하여 엔드 투 엔드로 모델을 훈련한다.
  • 인코더가 학습한 잠재 경로는 비선형적이고 분리되어 있어 선형 경로 가정에 비해 더 정확하고 현실적인 연령 진행을 가능하게 한다.
  • 노화 변환 후, 참조 이미지와 함께 레이어 8~9에서 스타일 믹싱을 수행함으로써 전반적인 조명, 털 색깔 등의 글로벌 특성에 대한 다중 모달 생성 및 정교한 편집이 가능해진다.
  • 특정 스타일 벡터에서 패치 편집을 통해 얼굴 수염이나 안경과 같은 국소적 편집이 가능하여 변환 후에도 특성별로 조작이 가능하다.

실험 결과

연구 질문

  • RQ1사전 훈련된 GAN의 잠재 공간에서 연령 변환을 이산적 연령 그룹에 의존하지 않고 연속적인 회귀 문제로 모델링할 수 있는가?
  • RQ2StyleGAN의 W+ 공간에서 비선형적이고 분리된 잠재 경로를 학습하는 것이 선형 경로 가정에 비해 더 현실적이고 신원을 유지하는 연령 진행을 가능하게 하는가?
  • RQ3사전 훈련된 연령 회귀 모델과 엔드 투 엔드 훈련의 조합이 실제 얼굴 이미지에 대해 고해상도의 연령 변환을 생성할 수 있는가?
  • RQ4생성된 노화 결과물이 StyleGAN의 네이티브 편집 기능을 통해 얼마나 더 많은 편집이 가능한가?
  • RQ5이 방법은 어린 어린이나 극단적인 표정과 같은 도전적인 케이스에서 어떻게 작동하며, 그 한계는 무엇인가?

주요 결과

  • SAM은 벤치마크 데이터셋에서 정성적·정량적 평가에서 모두 최신 기술 수준의 성능을 달성하며, 기존 방법들을 능가한다.
  • 이 방법은 어떤 입력 이미지도 목표 연령(예: 5세에서 85세로의 극단적 이동)으로 연속적이고 정교한 연령 진행을 가능하게 하며, 높은 수준의 신원 유지 성능을 보인다.
  • 이전의 선형 경로 방법에 비해 털 색깔, 얼굴 특징 등의 다른 특성들과 더 잘 분리된 잠재 경로를 학습함으로써 더 현실적이고 제어 가능한 노화 효과를 제공한다.
  • 모델의 엔드 투 엔드 구조 덕분에 스타일 믹싱과 패치 편집을 통해 추가 편집이 가능하여 다중 모달 생성 및 특성별 조작이 가능한 이미지를 생성할 수 있다.
  • 다양한 신원과 연령 범위에서 뛰어난 강건성을 보였지만, 연령 예측 편향이 있는 회귀 모델로 인해 매우 어린 어린이(<5세)에서는 성능이 저하된다.
  • 한계로는 도메인 외부 입력(예: 언니 사무), 극단적인 자세 또는 액세서리, 퇴색하는 털줄기나 피부 톤 변화와 같은 복잡한 변화를 모델링하기 어려운 점이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.