[논문 리뷰] StyleRig: Rigging StyleGAN for 3D Control over Portrait Images
StyleRig는 사전 훈련된 StyleGAN 생성기에서 3D 면모 모델(3DMM) 파라미터에서 StyleGAN의 잠재 공간으로의 매핑을 학습하는 새로운 RigNet를 통해 자기지도 학습 방식을 도입하여 3D 얼굴 라이팅 유사 제어를 가능하게 한다. 이 방법은 재학습이나 수동 애너테이션 없이 포즈, 표정, 조명, 정체성에 대한 명시적이고 분리된 제어를 가능하게 하며, 사진처럼 사실적인 포트레이트 생성을 달성한다.
StyleGAN generates photorealistic portrait images of faces with eyes, teeth, hair and context (neck, shoulders, background), but lacks a rig-like control over semantic face parameters that are interpretable in 3D, such as face pose, expressions, and scene illumination. Three-dimensional morphable face models (3DMMs) on the other hand offer control over the semantic parameters, but lack photorealism when rendered and only model the face interior, not other parts of a portrait image (hair, mouth interior, background). We present the first method to provide a face rig-like control over a pretrained and fixed StyleGAN via a 3DMM. A new rigging network, RigNet is trained between the 3DMM's semantic parameters and StyleGAN's input. The network is trained in a self-supervised manner, without the need for manual annotations. At test time, our method generates portrait images with the photorealism of StyleGAN and provides explicit control over the 3D semantic parameters of the face.
연구 동기 및 목표
- 사전 훈련된 StyleGAN은 사진처럼 사실적인 포트레이트를 생성하지만, 의미론적 얼굴 파라미터에 대한 라이팅 유사 제어 기능이 부족하므로, 이에 대한 해소를 목표로 한다.
- 3DMM은 의미론적 제어를 제공하지만 사진적 사실성에 빈도가 떨어지고, 머리카락이나 배경과 같은 비얼굴 영역을 모델링하지 못하므로 이에 기인한 한계를 극복한다.
- 재학습 없이 사전 훈련된 생성기에서 포즈, 표정, 조명, 정체성 등의 3D 얼굴 파라미터를 세밀하게 분리된 방식으로 편집할 수 있도록 보장한다.
- 수동 애너테이션을 피하고 사이클 일致성 및 미분 가능 렌더링을 활용하여 고해상도 이미지 생성을 위한 자기지도 학습 프레임워크를 개발한다.
제안 방법
- 고정된 사전 훈련된 StyleGAN의 잠재 공간으로 3DMM 의미론적 파라미터(예: 정체성, 포즈, 표정, 조명)를 매핑하기 위해 새로운 네트워크인 RigNet를 훈련한다.
- 3DMM과 잠재 공간에서의 정방향 및 역방향 편집 간의 일致성을 강제하는 자기지도 학습 기반의 양방향 사이클 일치 손실을 사용한다.
- 광학적 재구성 오차를 이미지 도메인에서 계산하기 위해 미분 가능 렌더러와 얼굴 재구성 네트워크를 통합하여 엔드 투 엔드 훈련을 가능하게 한다.
- 한 파라미터(예: 포즈)의 변경이 다른 파라미터(예: 정체성 또는 조명)에 부작용하지 않도록 보장하기 위해 사이클 일치 목표를 활용한다.
- 이미지 품질 유지를 위한 재구성 손실, 의미론적 일관성을 유지하기 위한 일치 손실, 제어 가능성을 위한 편집 손실을 조합하여 RigNet를 훈련한다.
- 최적화 과정 중 개별 파라미터 편집을 샘플링하고 훈련하여 단일 네트워크를 통해 포즈, 표정, 조명 등의 다중 파라미터를 동시에 제어할 수 있도록 한다.
실험 결과
연구 질문
- RQ1재학습이나 수동 애너테이션 없이 사전 훈련된 StyleGAN 생성기에서 의미론적이고 3D 인식된 제어를 달성할 수 있는가?
- RQ2자기지도 학습 방법이 3DMM 파라미터를 StyleGAN의 잠재 공간으로 효과적으로 매핑하면서도 사진적 사실성과 의미론적 속성의 분리성을 유지할 수 있는가?
- RQ3여러 3D 얼굴 파라미터를 동시에 편집할 때 정체성과 시나리오 일관성이 얼마나 잘 유지되는가?
- RQ4명시적인 3D 파라미터 제어를 통해 StyleGAN의 잠재 공간에서의 속성 엔트레인먼트 문제를 어느 정도 해결할 수 있는가?
- RQ5현재 방법이 머리카락, 배경, 입 안쪽과 같은 비얼굴 영역 제어에서 가지는 한계는 무엇인가?
주요 결과
- StyleRig는 3DMM 파라미터를 사용하여 StyleGAN 생성 포트레이트에 상호작용 가능한 라이팅 유사 제어를 가능하게 하며, 사진처럼 사실적인 결과를 얻는 고품질 편집을 달성한다.
- 기존의 직접적인 잠재 벡터 조정 또는 손실 함수 수정을 사용하는 베이스라인 방법보다 의미론적 편집 성능에서 최고 수준의 성능을 기록한다.
- 사이클 일치 손실이 편집의 정밀도를 크게 향상시켜, 편집 중 정체성 및 시나리오 파라미터에 의도하지 않은 변화가 발생하는 것을 방지한다.
- 포즈, 표정, 조명에 대한 동시에 제어가 성공적으로 구현되었으며, 편집 간 정체성이 유지됨을 입증하였다.
- 정체성과 시나리오 변화에 대해 강건한 성능을 보였으며, 소스 이미지에서 타겟 이미지로 파라미터를 전이하는 교차 도메인 편집을 통해 이를 입증하였다.
- 높은 성능에도 불구하고, 머리카락이나 배경과 같은 세부 사항은 3DMM이 모델링하지 않기 때문에 편집 시 예측 불가능하게 변화한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.