Skip to main content
QUICK REVIEW

[논문 리뷰] On Face Segmentation, Face Swapping, and Face Perception

Yuval Nirkin, Iacopo Masi|arXiv (Cornell University)|2017. 04. 22.
Face recognition and analysis참고 문헌 42인용 수 13
한 줄 요약

이 논문은 풍부하게 증강된 분할된 얼굴 데이터셋으로 훈련된 표준 완전 컨volution 네트워크(FCN)를 사용하여 강건한 얼굴 교체 방법을 제시한다. 얼굴 교체 시 내부 주체 간 교체(인물 동일)는 신원 인식 정확도를 유지하며(97.12% 정확도, 99.53% nAUC), 반면 이면 주체 간 교체(다른 인물)는 인식 성능을 떨어뜨린다—이를 통해 기계 시각에서 처음으로 인지 이론을 정량적으로 검증한다.

ABSTRACT

We show that even when face images are unconstrained and arbitrarily paired, face swapping between them is actually quite simple. To this end, we make the following contributions. (a) Instead of tailoring systems for face segmentation, as others previously proposed, we show that a standard fully convolutional network (FCN) can achieve remarkably fast and accurate segmentations, provided that it is trained on a rich enough example set. For this purpose, we describe novel data collection and generation routines which provide challenging segmented face examples. (b) We use our segmentations to enable robust face swapping under unprecedented conditions. (c) Unlike previous work, our swapping is robust enough to allow for extensive quantitative tests. To this end, we use the Labeled Faces in the Wild (LFW) benchmark and measure the effect of intra- and inter-subject face swapping on recognition. We show that our intra-subject swapped faces remain as recognizable as their sources, testifying to the effectiveness of our method. In line with well known perceptual studies, we show that better face swapping produces less recognizable inter-subject results. This is the first time this effect was quantitatively demonstrated for machine vision systems.

연구 동기 및 목표

  • 제약 조건이 없고 임의의 이미지 쌍에 적용 가능한 강건하고 일반적인 얼굴 교체 파이프라인을 개발하기 위해.
  • 풍부하고 다양한 데이터로 훈련된 경우 표준 FCN가 특수화된 분할 모델보다 우수한 성능을 낼 수 있음을 보여주기 위해.
  • 얼굴 교체가 기계적 얼굴 인식 성능에 미치는 영향을 정량적으로 평가하기 위해, 특히 내부 주체 및 이면 주체 간 교체의 영향을 분석하기 위해.
  • 더 나은 블렌딩이 인식 가능성 감소를 유도한다는 인지 현상이 기계 시각 기준으로 정량적으로 검증될 수 있도록 하기 위해.
  • 정량적 평가 프로토콜을 포함한 재현 가능하고 오픈소스의 얼굴 교체 파이프라인을 제공하기 위해.

제안 방법

  • 운동 신호와 3D 데이터 증강을 활용한 준지도 학습 방식을 통해 다양한 얼굴 분할 마스크를 포함한 대규모 데이터셋을 생성한다.
  • 풍부한 데이터셋으로 표준 완전 컨volution 네트워크(FCN)를 훈련시켜 빠르고 정확한 픽셀 단위의 얼굴 분할을 수행한다.
  • 향상된 분할 기법과 강력한 정렬 및 블렌딩을 통합한 얼굴 교체 파이프라인을 구현하며, 현실감을 높이기 위해 추정된 또는 일반적인 3D 얼굴 형태를 활용한다.
  • 사전 제어 없이도 제약 조건이 없는 이미지, 특히 극단적인 시점 및 표정 변화가 있는 이미지에 대해 얼굴 교체를 수행한다.
  • LFW 벤치마크를 사용하여 정량적 평가를 수행하며, 내부 주체 간 교체(동일한 신원)와 이면 주체 간 교체(다른 신원)를 위한 두 가지 평가 프rotocol를 설정한다.
  • 100%-EER, 정확도, nAUC를 통해 얼굴 인식 성능을 측정하여 교체가 신원 유지에 미치는 영향을 평가한다.

실험 결과

연구 질문

  • RQ1풍부하고 다양한 분할된 얼굴 데이터셋으로 훈련된 표준 FCN가 최첨단의 분할 정확도와 속도를 달성할 수 있는가?
  • RQ2제약 조건이 없고 임의의 쌍으로 조합된 이미지 간 얼굴 교체가 얼굴 인식 성능으로 측정했을 때 주체의 신원을 유지하는가?
  • RQ3향상된 블렌딩이 소스 얼굴의 인식 가능성 감소에 얼마나 기여하는가? 이는 정량적으로 측정할 수 있는가?
  • RQ4추정된 3D 얼굴 형태는 일반적 또는 비모델링된 경우에 비해 블렌딩 품질과 인식 영향 측면에서 어떻게 비교되는가?
  • RQ5더 나은 블렌딩이 인식 가능성 감소를 유도한다는 인지 현상이 기계 시각 시스템에서 정량적으로 관찰될 수 있는가?

주요 결과

  • 제안된 FCN 기반 분할 기법은 풍부한 훈련 데이터 덕분에 특수화된 모델을 능가하는 최첨단의 정확도와 속도를 달성한다.
  • 내부 주체 간 얼굴 교체 시 인식 정확도가 1% 이하로 떨어지며(97.12% 대비 기준 98.12%), 이는 신원 왜곡이 최소한임을 시사한다.
  • 이면 주체 간 얼굴 교체 시 인식 성능이 크게 떨어지며, 100%-EER가 기준 98.10%에서 64.58%로 떨어지며, 더 나은 블렌딩이 인식 가능성 감소를 유도함을 확인한다.
  • 추정된 3D 얼굴 형태를 사용할 경우 블렌딩 품질이 향상되어 이면 주체 간 교체 시 100%-EER가 73.17%로 떨어지며, 더 강한 신원 은폐 효과를 나타낸다.
  • 이 방법은 기계 시각에서 클린턴-고어 환각 현상에 대해 처음으로 대규모 정량적 검증을 가능하게 하며, 더 나은 얼굴 교체가 더 인식하기 어려운 얼굴을 만든다는 것을 보여준다.
  • 교체 후에도 맥락적 특징이 여전히 정보를 제공함을 확인할 수 있으며, '맥락 유지' 프로토콜에서 더 높은 인식 정확도를 기록함으로써 맥락과 얼굴이 모두 신원 인식에 기여함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.