[논문 리뷰] FReeNet: Multi-Identity Face Reenactment
FReeNet는 잠재적 랜드마크 공간을 사용하여 얼굴 기하학과 외관을 분리함으로써 다중 신원 얼굴 재연에 대한 통합 프레임워크를 제안한다. 이는 표현을 다양한 신원 간에 전달하는 데 사용되는 통합 랜드마크 컨버터(ULC)와 삼중 퍼셉추얼 손실을 갖춘 기하학적 인식 생성자(GAG)를 활용하여 사진처럼 사실적인 결과를 얻고 신원 일관성을 유지한다. 이는 표현 전달 및 세부 사항 보존 측면에서 최신 기술 수준의 성능을 달성한다.
This paper presents a novel multi-identity face reenactment framework, named FReeNet, to transfer facial expressions from an arbitrary source face to a target face with a shared model. The proposed FReeNet consists of two parts: Unified Landmark Converter (ULC) and Geometry-aware Generator (GAG). The ULC adopts an encode-decoder architecture to efficiently convert expression in a latent landmark space, which significantly narrows the gap of the face contour between source and target identities. The GAG leverages the converted landmark to reenact the photorealistic image with a reference image of the target person. Moreover, a new triplet perceptual loss is proposed to force the GAG module to learn appearance and geometry information simultaneously, which also enriches facial details of the reenacted images. Further experiments demonstrate the superiority of our approach for generating photorealistic and expression-alike faces, as well as the flexibility for transferring facial expressions between identities.
연구 동기 및 목표
- 단일 통합 모델 내에서 임의의 소스 및 타겟 신원 간에 얼굴 표정을 전달하는 데 도전하는 문제를 해결한다.
- 표현 전달 과정에서 소스 및 타겟 얼굴 간의 얼굴 윤곽 간 격차를 극복한다.
- 신원, 자세, 조명 및 얼굴 세부 사항을 유지하는 사진처럼 사실적인 재연을 가능하게 한다.
- 기하학과 외관 정보를 분리하여 얼굴 특성에 대한 민첩한 제어를 가능하게 한다.
- 각 타겟에 맞는 네트워크 적응이 필요 없이도 많은 수의 신원 간 재연을 위한 민첩하고 확장 가능한 프레임워크를 개발한다.
제안 방법
- 얼굴을 기하학적 구조를 유지하면서 외관을 제거하는 잠재적 랜드마크 공간에 통합하기 위해 랜드마크 검출기를 사용한다.
- 잠재적 랜드마크 공간에서 신원 간 표현을 전달하기 위해 인코더-디코더 아키텍처를 갖춘 통합 랜드마크 컨버터(ULC)를 구현한다.
- 변환된 랜드마크와 기준 이미지의 외관을 융합하여 사진처럼 사실적인 출력을 생성하는 기하학적 인식 생성자(GAG)를 설계한다.
- 외관과 기하학 정보를 분리하기 위해 삼중 손실과 퍼셉추얼 손실을 결합한 새로운 삼중 퍼셉추얼 손실을 도입한다.
- GAG에 삼중 퍼셉추얼 손실을 적용하여 얼굴 세부 사항 생성 및 신원 일관성을 향상시킨다.
- 잠재 공간에서의 랜드마크 보간 및 편집을 통해 동적 얼굴 특성 조정이 가능하도록 한다.
실험 결과
연구 질문
- RQ1재훈련 없이도 각 타겟에 맞게 조정이 필요 없이 통합 딥 러닝 프레임워크가 다수의 신원 간에 효과적으로 표정을 전달할 수 있는가?
- RQ2소스와 타겟 얼굴의 윤곽이 다를 경우, 표정 전달 과정에서 기하학적 구조를 어떻게 유지할 수 있는가?
- RQ3삼중 퍼셉추얼 손실이 얼굴 재연에서 세부 사항 생성을 향상시키고 외관과 기하학을 얼마나 잘 분리할 수 있는가?
- RQ4기준 이미지만을 사용하여도 사진처럼 사실적인 결과를 생성하면서 신원 일관성을 유지할 수 있는가?
- RQ5랜드마크 편집을 통한 랜드마크 공간의 분리 설계가 얼굴 특성 제어를 얼마나 효과적으로 가능하게 하는가?
주요 결과
- ULC 모듈은 기하학적 일관성을 크게 향상시켜, 이를 사용하지 않은 모델 대비 SSIM 점수를 크게 높인다.
- 완전한 FReeNet 모델은 FID와 SSIM 측면에서 최신 기술 수준의 성능을 달성하여 뛰어난 사진적 사실성과 구조적 충실도를 입증한다.
- 삼중 퍼셉추얼(TP) 손실은 GAG가 주름, 눈썹, 입 윤곽 등의 더 풍부한 얼굴 세부 사항을 생성하도록 한다.
- 기준 이미지가 수정되어도(예: 메이크업 또는 노이즈) 신원 일관성이 유지되어 효과적인 외관 분리가 이루어졌음을 확인한다.
- 잠재 공간에서의 랜드마크 보간 및 편집은 부드럽고 제어 가능한 전환과 특성별 편집을 가능하게 하여 분리 설계의 타당성을 검증한다.
- 절단 실험을 통해 ULC와 TP 손실이 고성능 재연을 위해 필수적임을 확인하였으며, 병합된 구성 요소가 개별 모듈보다 우수한 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.