[논문 리뷰] MarioNETte: Few-shot Face Reenactment Preserving Identity of Unseen Targets
MarioNETte는 이미지 어텐션 블록, 타겟 특징 정렬, 그리고 새로운 랜드마크 트랜스포머를 활용하여 드라이버-타겟 정체성 불일치로 인한 정체성 유지 실패 문제를 완화함으로써, 미리 보지 않은 타겟의 정체성을 유지하는 소수 샘플 얼굴 재연 프레임워크를 제안한다. 이 방법은 미세조정 없이도 최신 기술 수준의 성능을 달성하며, 큰 자세 변화나 정체성 차이가 있는 상황에서도 실사성과 정체성 충실도를 크게 향상시킨다.
When there is a mismatch between the target identity and the driver identity, face reenactment suffers severe degradation in the quality of the result, especially in a few-shot setting. The identity preservation problem, where the model loses the detailed information of the target leading to a defective output, is the most common failure mode. The problem has several potential sources such as the identity of the driver leaking due to the identity mismatch, or dealing with unseen large poses. To overcome such problems, we introduce components that address the mentioned problem: image attention block, target feature alignment, and landmark transformer. Through attending and warping the relevant features, the proposed architecture, called MarioNETte, produces high-quality reenactments of unseen identities in a few-shot setting. In addition, the landmark transformer dramatically alleviates the identity preservation problem by isolating the expression geometry through landmark disentanglement. Comprehensive experiments are performed to verify that the proposed framework can generate highly realistic faces, outperforming all other baselines, even under a significant mismatch of facial characteristics between the target and the driver.
연구 동기 및 목표
- 드라이버의 얼굴 특징가 타겟과 상당히 다를 경우 정체성 유지에 실패하는 소수 샘플 얼굴 재연 문제를 해결하기 위해.
- 재연 대상이 새로운 정체성일 경우, 미세조정이나 재학습이 필요 없도록 하기 위해.
- 큰 자세 변화나 정체성 불일치 상황에서도 재연 품질을 향상시키기 위해.
- 라벨이 없는 데이터를 사용하여 드라이버 랜드마크를 타겟 정체성에 맞게 적응시키는 비지도 방법을 개발하기 위해.
제안 방법
- 모델은 3D 랜드마크 검출기를 포함한 프리프로세서를 사용하여 얼굴 키포인트를 추출하고 정규화하며, 이를 랜드마크 트랜스포머에 활용하여 표현과 정체성 기하학을 분리한다.
- 이미지 어텐션 블록은 생성자에게 타겟 특징 맵의 관련 공간 위치에 동적으로 주의를 기울일 수 있도록 하여 합성 과정 중 특징 주입을 향상시킨다.
- 타겟 특징 정렬은 특징 수준에서 여러 워핑 연산을 적용하여 다양한 자세와 정체성 간의 타겟 특징을 정렬한다.
- 생성자는 U-Net 기반의 타겟 인코더를 사용하여 스타일 특징을 추출하고 변형된 타겟 특징 맵을 생성한다.
- 블렌더 모듈은 드라이버 자세/표정 특징과 타겟 스타일 특징을 융합하여 이미지 생성을 위한 혼합 특징 맵을 생성한다.
- 조건부 GAN 프레임워크와 디스크림ิน레이터를 사용하여 적대적 훈련을 통해 현실적인 이미지 출력을 보장한다.
실험 결과
연구 질문
- RQ1드라이버와 타겟의 얼굴 특징가 상당히 다를 경우, 소수 샘플 얼굴 재연 모델이 새로운 타겟의 정체성을 유지할 수 있는가?
- RQ2각 타겟 정체성에 대해 미세조정이나 라벨 데이터가 없을 경우, 정체성 유지 성능을 어떻게 향상시킬 수 있는가?
- RQ3비지도 랜드마크 변환은 얼굴 재연 과정에서 정체성 불일치 문제를 어느 정도 완화할 수 있는가?
- RQ4이미지 어텐션과 특징 수준의 워핑을 조합하면, 큰 자세 변화 조건에서 기존 방법보다 정체성 유지와 실사성 측면에서 더 우수한 성능을 내는가?
주요 결과
- MarioNETte는 VoxCeleb1 및 CelebV 데이터셋에서 모두 최신 기술 수준의 베이스라인을 압도하며, 특히 정체성 불일치 조건에서 뛰어난 성능을 보였다.
- 제거 실험 결과, 이미지 어텐션과 타겟 특징 정렬을 조합할 경우 가장 우수한 성능을 내었으며, CSIM 점수는 AdaIN 또는 단일 구성 요소 버전보다 뚜렷이 높았다.
- 랜드마크 트랜스포머 덕분에 드라이버의 정체성 간섭이 감소하였으며, 이는 드라이버와 타겟의 얼굴 특징이 다를 경우에도 정체성 유지 지표가 향상된 것으로 확인되었다.
- 사용자 연구 결과, 특히 도전적인 소수 샘플 설정에서 기존 방법보다 더 현실적이며 정체성 유지가 잘 되는 결과를 생성함을 확인하였다.
- 이전 방법이 워핑 아티팩트로 인해 실패하는 큰 자세에서도 MarioNETte는 높은 품질의 재연을 유지하였다.
- 어텐션 맵을 통해 MarioNETte가 적절한 타겟 이미지에서 관련 있는 얼굴 영역(예: 이마)에 정확히 주의를 기울이고 있음을 확인하였으며, 잘못된 정렬을 방지함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.