[논문 리뷰] FaceController: Controllable Attribute Editing for Face in the Wild
FaceController는 3DMM 사전지식, 신원 임bedding 및 영역별 스타일 코드를 활용하여 야생 이미지에서 고해상도이고 제어 가능한 얼굴 속성 편집을 가능하게 하는 피드포워드 생성 네트워크를 제안한다. 이는 GAN 역전환을 비용이 많이 드는 과정 없이도 신원 유지, 해상도 향상 및 분리된 편집 성능에서 최신 기술 수준(SOTA)을 달성한다. 얼굴 교체, 조명 재설정, 메이크업 이동 등 다양한 작업에 적용 가능하다.
Face attribute editing aims to generate faces with one or multiple desired face attributes manipulated while other details are preserved. Unlike prior works such as GAN inversion, which has an expensive reverse mapping process, we propose a simple feed-forward network to generate high-fidelity manipulated faces. By simply employing some existing and easy-obtainable prior information, our method can control, transfer, and edit diverse attributes of faces in the wild. The proposed method can consequently be applied to various applications such as face swapping, face relighting, and makeup transfer. In our method, we decouple identity, expression, pose, and illumination using 3D priors; separate texture and colors by using region-wise style codes. All the information is embedded into adversarial learning by our identity-style normalization module. Disentanglement losses are proposed to enhance the generator to extract information independently from each attribute. Comprehensive quantitative and qualitative evaluations have been conducted. In a single framework, our method achieves the best or competitive scores on a variety of face applications.
연구 동기 및 목표
- GAN 역전환의 비효율성을 해결하기 위해 속도가 빠른 피드포워드 네트워크로 이를 대체하여 속성 편집을 수행하는 것.
- 신원, 자세, 표정, 조명, 국소 영역 스타일의 다섯 가지 핵심 얼굴 속성을 분리하여 정밀한 제어를 가능하게 하는 것.
- 3DMM로 렌더링된 얼굴과 실제 야생 얼굴 간의 도메인 갭을 해소하기 위해 신원 및 영역별 스타일 임베딩을 통합하는 것.
- 통합 프레임워크를 통해 얼굴 교체, 조명 재설정, 메이크업 이동 등 다양한 응용을 가능하게 하는 것.
- 비지도 손실과 새로운 신원-스타일 정규화 모듈을 통해 분리도 및 제어 가능성을 향상시키는 것.
제안 방법
- 신원, 자세, 표정의 분리에 강력한 사전지식으로서 3DMM 계수를 사용한다.
- 신원 임베딩과 영역별 스타일 코드를 융합하여 3DMM의 특징 맵을 조절하는 신원-스타일 정규화 모듈을 도입한다.
- 신원, 랜드마크 일致성, 히스토그램 매칭을 위한 비지도 손실을 활용하여 분리된 제어를 강제한다.
- 생성기로부터 각 속성을 독립적으로 추출하도록 분리도 손실을 적용한다.
- 시간이 오래 걸리는 GAN 역전환 대신 기존에 쉽게 확보할 수 있는 사전지식(3DMM, 신원, 스타일 코드)을 활용한다.
- 신원-스타일 정규화 모듈과 함께 적대적 훈련을 수행하여 사진 수준의 현실감 있는 얼굴을 생성한다.
실험 결과
연구 질문
- RQ1비용이 많이 드는 GAN 역전환에 의존하지 않고도 피드포워드 네트워크가 고해상도 얼굴 편집을 달성할 수 있는가?
- RQ23DMM 사전지식과 함께 신원 및 영역별 스타일 코드를 결합하면 합성된 얼굴과 실제 얼굴 간의 도메인 갭을 효과적으로 해소할 수 있는가?
- RQ3제안된 방법이 다섯 가지 별개의 얼굴 속성(신원, 자세, 표정, 조명, 국소 스타일)을 분리하여 정밀한 편집이 가능한가?
- RQ4신원-스타일 정규화 모듈은 이전 방법 대비 분리도 및 생성 품질을 어떻게 향상시키는가?
- RQ5얼굴 교체, 메이크업 이동, 조명 재설정 작업에서 기존 방법들에 비해 어느 정도 성능을 뛰어넘는가?
주요 결과
- FaceForensics++에서 비교된 방법들 중에서 FaceController는 가장 높은 신원 복원 정확도(98.27)와 가장 낮은 FID(3.51)를 기록하여 DeepFake, FaceSwap, FSGAN, FaceShifter를 모두 앞서나간다.
- 사용자 연구에서 FaceController는 해상도 품질 55.4점, 신원 유지 44.7점, 메이크업 이동 가능성 45.4점을 기록하여 SEAN 및 LADN을 모두 초월하는 종합 품질을 확보한다.
- 제거 실험에서 신원 인코더를 제거하면 신원 복원 정확도가 25.97로 떨어지며, 이는 신원 인코더가 원본 신원 유지에 핵심적인 역할을 한다는 것을 확인한다.
- 스타일 인코더를 제거하면 입술과 같은 국소 영역의 질감이 일관되지 않게 되며, FID가 4.84로 상승함으로써 세밀한 편집을 위한 중요성을 입증한다.
- 랜드마크 일치 및 히스토그램 매칭 손실은 필수적이다. 이들을 생략할 경우 눈 주변에 잡음이 발생하고 색상 분포가 일관되지 않게 된다.
- 통합 프레임워크 하나로 얼굴 교체, 조명 재설정, 메이크업 이동 등 다양한 편집 작업에서 뛰어난 성능 유지를 기록한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.