[논문 리뷰] MorphGAN: One-Shot Face Synthesis GAN for Detecting Recognition Bias
MorphGAN은 단일 기준 이미지와 3D 형태 모델을 사용하여 정신을 유지하면서 제어 가능한 머리 자세와 표정 변화를 갖는 고해상도 얼굴 이미지를 생성하는 조건부 GAN입니다. 이는 얼굴 인식 시스템의 편향 탐지 및 소규모 데이터셋에서의 데이터 증강에 활용되었을 때 정확도를 최대 9% 향상시킵니다.
To detect bias in face recognition networks, it can be useful to probe a network under test using samples in which only specific attributes vary in some controlled way. However, capturing a sufficiently large dataset with specific control over the attributes of interest is difficult. In this work, we describe a simulator that applies specific head pose and facial expression adjustments to images of previously unseen people. The simulator first fits a 3D morphable model to a provided image, applies the desired head pose and facial expression controls, then renders the model into an image. Next, a conditional Generative Adversarial Network (GAN) conditioned on the original image and the rendered morphable model is used to produce the image of the original person with the new facial expression and head pose. We call this conditional GAN -- MorphGAN. Images generated using MorphGAN conserve the identity of the person in the original image, and the provided control over head pose and facial expression allows test sets to be created to identify robustness issues of a facial recognition deep network with respect to pose and expression. Images generated by MorphGAN can also serve as data augmentation when training data are scarce. We show that by augmenting small datasets of faces with new poses and expressions improves the recognition performance by up to 9% depending on the augmentation and data scarcity.
연구 동기 및 목표
- 훈련 데이터의 다양성 부족으로 인해 얼굴 인식 모델에서 인식 편향을 탐지하는 데 어려움이 있는 문제를 해결하기 위해, 특히 자세와 표정 측면에서.
- 단일 기준 이미지에서 정신을 유지하면서 제어 가능한 자세와 표정 변화를 갖는 현실적인 얼굴 이미지를 생성하는 방법을 개발하기 위해.
- 오직 한 가지 속성만 변화된 테스트 세트를 생성함으로써 얼굴 인식 모델의 민감도 테스트를 가능하게 하기 위해.
- 작은 데이터셋에 합성된 다양한 자세와 표정을 추가하여 얼굴 인식 시스템의 강인성을 향상시키기 위해.
- 3D 형태 모델과 조건부 GAN을 결합하여 다수의 기준 이미지가 필요 없이 고해상도이고 제어 가능한 얼굴 합성 결과를 도출하기 위해.
제안 방법
- 3D 형태 모델 피팅을 통해 단일 입력 이미지에서 FLAME 3D 얼굴 모델의 매개변수(형태, 자세, 표정)를 추정합니다.
- 추정된 3D 모델 매개변수를 조정하여 원하는 머리 자세와 표정 변화를 적용하고, 새로운 3D 얼굴 이미지를 렌더링합니다.
- 원본 이미지와 렌더링된 3D 모델을 입력으로 받아 새로운 자세와 표정을 가진 동일한 정신의 현실적인 이미지를 생성하는 조건부 GAN(MorphGAN)을 훈련합니다.
- 실제 또는 가짜 이미지, 형태 렌더링, 스타일 벡터를 입력으로 받는 글로벌 판별자를 사용하여 현실성과 일관성을 강화합니다.
- 지역적 이미지의 현실성을 평가함으로써 세밀한 디테일을 향상시키고 아티팩트를 줄이는 패치 판별자를 활용합니다.
- 자세 차이에 따른 배치를 균형 잡음으로써 큰 자세 변화 범위에서의 일반화 성능을 향상시키고 아티팩트를 감소시킵니다.
실험 결과
연구 질문
- RQ1조건부 GAN은 단일 기준 이미지에서 정신을 유지하면서 제어 가능한 자세와 표정 변화를 갖는 사진 수준의 현실적인 얼굴 이미지를 생성할 수 있는가?
- RQ2MorphGAN가 생성한 이미지는 자세와 표정과 관련된 얼굴 인식 모델의 편향을 어느 정도 효과적으로 탐지할 수 있는가?
- RQ3MorphGAN은 소규모 데이터셋에서 얼굴 인식 성능 향상에 있어 데이터 증강 기법으로서 얼마나 효과적인가?
- RQ4기존의 GAN 기반 얼굴 합성 방법과 비교했을 때 MorphGAN은 정신 유지 및 속성 제어 측면에서 어떤가?
- RQ53D 형태 모델과 조건부 GAN의 조합은 제한된 감독 하에 엔드 투 엔드 GAN보다 더 높은 품질의 결과를 도출할 수 있는가?
주요 결과
- Qualitative 비교를 통해 MorphGAN은 정신을 유지하면서 정확한 자세와 표정 제어를 갖는 고해상도 얼굴 이미지를 성공적으로 생성함을 입증함.
- 오직 한 가지 속성(자세 또는 표정)만 변화된 제어 가능한 테스트 세트를 생성함으로써 얼굴 인식 모델의 민감도 테스트를 효과적으로 가능하게 함.
- 데이터 증강에 사용되었을 때 MorphGAN은 소규모 데이터셋에서 얼굴 인식 정확도를 최대 9% 향상시키며, 증강 전략과 데이터 부족 수준에 따라 달라짐.
- 자세 차이에 따른 배치 균형 조정은 특히 큰 자세 변화에서 자세의 정확성 향상과 아티팩트 감소에 크게 기여함.
- 단일 기준 이미지만을 사용함에도 불구하고, Zakharov 등 [50] 및 X2Face [49]와 같은 기준 방법보다 정신 유지 및 시각적 품질 측면에서 우수함.
- 글로벌 및 패치 판별자 모두의 사용은 특히 얼굴 텍스처와 기하학적 구조에서 현실성과 디테일 일관성을 향상시킴.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.