Skip to main content
QUICK REVIEW

[논문 리뷰] Generation of Non-Deterministic Synthetic Face Datasets Guided by Identity Priors

Marcel Grimmer, Haoyu Zhang|arXiv (Cornell University)|2021. 12. 07.
Face recognition and analysis인용 수 4
한 줄 요약

이 논문은 스타일 제너레이터 내에서 주성분 분석(PCA)을 통한 잠재공간 조작을 활용하여 비결정적인 방법으로 합성된 쌍둥이 얼굴 이미지를 생성하는 방법을 제안한다. 이는 사전 훈련된 얼굴 인식 시스템을 통해 동적 신원 유지 기능을 제공하며, 77,034장의 이미지와 25,919개의 신원을 포함한 SymFace 데이터셋을 구축한다. 합성된 쌍둥이 샘플은 실제 생체인식 데이터와 유사한 분리된 진짜 및 위조 점수 분포를 보이며, 개인정보 유출 및 편향 문제를 피하면서도 생체인식 성능 테스트에 유용하게 활용될 수 있음을 입증한다.

ABSTRACT

Enabling highly secure applications (such as border crossing) with face recognition requires extensive biometric performance tests through large scale data. However, using real face images raises concerns about privacy as the laws do not allow the images to be used for other purposes than originally intended. Using representative and subsets of face data can also lead to unwanted demographic biases and cause an imbalance in datasets. One possible solution to overcome these issues is to replace real face images with synthetically generated samples. While generating synthetic images has benefited from recent advancements in computer vision, generating multiple samples of the same synthetic identity resembling real-world variations is still unaddressed, i.e., mated samples. This work proposes a non-deterministic method for generating mated face images by exploiting the well-structured latent space of StyleGAN. Mated samples are generated by manipulating latent vectors, and more precisely, we exploit Principal Component Analysis (PCA) to define semantically meaningful directions in the latent space and control the similarity between the original and the mated samples using a pre-trained face recognition system. We create a new dataset of synthetic face images (SymFace) consisting of 77,034 samples including 25,919 synthetic IDs. Through our analysis using well-established face image quality metrics, we demonstrate the differences in the biometric quality of synthetic samples mimicking characteristics of real biometric data. The analysis and results thereof indicate the use of synthetic samples created using the proposed approach as a viable alternative to replacing real biometric data.

연구 동기 및 목표

  • 실제 생체인식 데이터셋을 활용한 얼굴 인식 테스트에서 발생하는 개인정보 유출 및 인구 통계적 편향 문제를 해결하기 위해.
  • 실세계 생체인식 데이터에서 관찰되는 신원 내 변화(예: 자세, 표정, 조명 변화 등)를 재현하는 합성 얼굴 이미지를 생성하기 위해.
  • 잠재공간 내 비결정적 샘플링에도 불구하고 합성 이미지 생성 과정에서 신원 유지 보장을 확보하기 위해.
  • 생체인식 성능 평가에 적합한 대규모이고 개인정보 보호 기반의 합성 데이터셋을 구축하기 위해.

제안 방법

  • 512차원 잠재벡터로 표현되는 기반 합성 얼굴 이미지를 생성하기 위해 사전 훈련된 스타일 제너레이터를 사용한다.
  • 50,000장의 생성된 이미지의 잠재공간에 주성분 분석(PCA)을 적용하여 편집에 유의미한 의미를 부여하는 방향을 식별한다.
  • 상위 주성분 방향으로 잠재벡터를 변형하여 얼굴 특성에 대한 현실적인 변형을 도입함으로써 쌍둥이 샘플을 생성한다.
  • 사전 훈련된 얼굴 인식 모델(FR)을 활용해 원본 이미지와 편집된 이미지 간의 유사도를 동적으로 모니터링하고 제어함으로써 신원 유지 보장을 달성한다.
  • FR 시스템이 원본과 생성된 이미지 간의 코사인 유사도를 평가하여 편향의 크기를 지도하는 피드백 루프를 구현한다.
  • 자세, 조명, 미소 등의 변형을 포함하여 총 77,034장의 이미지와 25,919개의 합성 신원을 포함하는 SymFace 데이터셋을 구성한다.

실험 결과

연구 질문

  • RQ1스타일 제너레이터 내 잠재공간 조작을 통해 비결정적 방식으로 쌍둥이 얼굴 이미지를 생성하면서도 신원 유지 정확도를 유지는 것이 가능한가?
  • RQ2잠재공간 내에서 유도된 PCA 방향이 실제 생체인식 데이터와 유사한 의미 있는 얼굴 변화를 생성하는 데 얼마나 효과적인가?
  • RQ3FRGC v2.0와 같은 실제 본래의 생체인식 데이터셋과 비교했을 때, 합성된 쌍둥이 샘플의 생체인식 비교 점수 분포는 어떻게 유사한가?
  • RQ4합성된 쌍둥이 샘플이 성능 테스트에 적합한 잘 분리된 진짜 및 위조 점수 분포를 생성할 수 있는가?
  • RQ5합성 이미지의 얼굴 품질 평가 지표는 실제 세계 기준과 비교해 어떻게 나타나는가?

주요 결과

  • PCA-FR 가이드 샘플링 기법은 쌍둥이 비교 점수 분포가 비쌍둥이 점수와 잘 분리되어 있음을 보이며, 커널 밀도 곡선 상에서 명확한 구분이 관찰된다.
  • 제안된 방법의 쌍둥이 점수 분포와 FRGC v2.0 간의 쿨백-라이블러 발산(KL 발산) 값은 0.42로, 진짜 점수 패턴에서 중간 수준의 유사성을 나타내며 수용 가능한 정도이다.
  • 미소 편집 샘플에 대해 합성 데이터셋은 FRGC v2.0와 KL 발산 0.17을 기록하여 이 속성에 대해 내부 클래스 변동에서 강력한 일치를 보임을 시사한다.
  • 얼굴 품질 평가 지표(SER-FIQ 및 FaceQnet v1) 분석 결과, 합성 이미지의 품질 분포가 실제 데이터와 유사함을 확인하였으며, SER-FIQ 점수는 PCA-FR 기반 생성 시 1.17, 조명 편집 시 1.19를 기록하였다.
  • 모든 합성 데이터셋의 비쌍둥이 비교 점수 분포는 FMR=0.1% 기준 이하로 유지되어 있어, 낮은 오류 매칭 위험과 낮은 유사한 외모 생성 가능성을 보였다.
  • 자세 각도 편집 결과, 모든 속성 중에서 쌍둥이 비교 점수의 범위가 가장 넓었으며, 이는 자세 관련 편집에서 더 높은 변동성을 가짐을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.