Skip to main content
QUICK REVIEW

[논문 리뷰] FAN: Feature Adaptation Network for Surveillance Face Recognition and Normalization

Xi Yin, Ying Tai|arXiv (Cornell University)|2019. 11. 26.
Face recognition and analysis참고 문헌 62인용 수 10
한 줄 요약

이 논문은 품질이 낮고 제약 조건이 많은 영상에서 신원 보존이 중요한 감시용 얼굴 인식 및 정규화를 동시에 수행하기 위해 신원과 비신원 특징을 분리함으로써 쌍체의 데이터와 비쌍체의 데이터 모두에서 학습이 가능한 FAN(FEATURE ADAPTATION NETWORK)을 제안한다. FAN은 분리된 특징 학습과 무작위 스케일 증강을 활용하여 SCface, WIDER FACE, QUML-SurvFace에서 최신 기준 성능(SOTA)을 달성한다.

ABSTRACT

This paper studies face recognition (FR) and normalization in surveillance imagery. Surveillance FR is a challenging problem that has great values in law enforcement. Despite recent progress in conventional FR, less effort has been devoted to surveillance FR. To bridge this gap, we propose a Feature Adaptation Network (FAN) to jointly perform surveillance FR and normalization. Our face normalization mainly acts on the aspect of image resolution, closely related to face super-resolution. However, previous face super-resolution methods require paired training data with pixel-to-pixel correspondence, which is typically unavailable between real-world low-resolution and high-resolution faces. FAN can leverage both paired and unpaired data as we disentangle the features into identity and non-identity components and adapt the distribution of the identity features, which breaks the limit of current face super-resolution methods. We further propose a random scale augmentation scheme to learn resolution robust identity features, with advantages over previous fixed scale augmentation. Extensive experiments on LFW, WIDER FACE, QUML-SurvFace and SCface datasets have shown the effectiveness of our method on surveillance FR and normalization.

연구 동기 및 목표

  • 저해상도이자 제약 조건이 많은 영상에서 신원 보존이 중요한 감시용 얼굴 인식 및 정규화 문제를 해결하기 위해.
  • 기존의 얼굴 초해상도 방법이 픽셀 간 대응 관계가 있는 쌍체 학습 데이터를 필요로 하는 한계를 극복하기 위해.
  • 쌍체 및 비쌍체 데이터를 모두 활용하여 얼굴 인식과 정규화를 동시에 학습함으로써 해상도 변화에 대한 강건성을 향상시키기 위해.
  • 얼굴의 세부 정보를 향상시키면서도 신원을 유지하고 자세, 조명, 표정 변화를 완화하는 방법을 개발하기 위해.
  • 감시 환경에서 알려지지 않은 다양한 입력 해상도에 일반화할 수 있도록 하는 무작위 스케일 증강 전략을 도입하기 위해.

제안 방법

  • FAN은 이중 단계 프레임워크를 사용한다: 첫 번째로, 인코더-디코더 구조를 이용해 고해상도 이미지에서 신원 및 비신원 성분을 분리하는 분리된 특징 학습을 수행한다.
  • 두 번째로, 분리된 특징 공간에서 저해상도 및 고해상도 인코더 간의 신원 특징 분포를 정렬함으로써 비쌍체 학습이 가능하도록 한다.
  • 신원 보존을 위해 특징 수준과 이미지 수준의 유사성 정규화를 사용하여 인식 정확도를 향상시킨다.
  • 학습 중에 다양한 저해상도 입력을 생성하기 위해 새로운 무작위 스케일 증강(RSA) 전략을 도입하여 감시 데이터의 알려지지 않은 해상도 변화에 대한 강건성을 향상시킨다.
  • 재구성 손실, 신원 분류 손실, 특징 분포 정렬 손실의 조합을 통해 엔드 투 엔드로 프레임워크를 학습시킨다.
  • 디코더는 저해상도 특징에서 고해상도 얼굴 이미지를 재구성하여, 외관적으로 향상되고 신원을 유지하는 출력을 생성한다.

실험 결과

연구 질문

  • RQ1쌍체 학습 데이터가 필요 없이도 통합된 프레임워크가 감시 영상에서 얼굴 인식과 정규화를 동시에 향상시킬 수 있는가?
  • RQ2자세, 조명 등의 비신원 요소에서 신원 특징을 어떻게 분리하여 저해상도 환경에서의 인식 강건성을 향상시킬 수 있는가?
  • RQ3무작위 스케일 증강 전략이 감시 얼굴 인식에서 알려지지 않은 다양한 입력 해상도에 대한 일반화 능력을 어느 정도 향상시키는가?
  • RQ4분리된 신원 공간에서의 특징 적응이 비쌍체 데이터에서 효과적인 학습을 가능하게 하여 전통적인 얼굴 초해상도 방법의 한계를 극복할 수 있는가?
  • RQ5제안된 방법은 인식 정확도와 정규화된 얼굴의 시각적 품질 측면에서 최신 기준(SOTA) 기법들과 비교해 어떻게 성능을 내는가?

주요 결과

  • FAN은 SCface 테스트 세트에서 90.3%의 랭크-1 인식 성능를 달성하여, 모든 비피인식 기반 기준 모델을 능가했으며, 테스트 시 해상도 정보가 없어도 DCR를 초월한다.
  • RSA를 사용하여 SCface 학습 세트에서 피인식을 수행한 후 FAN은 랭크-1 정확도 90.3%를 달성하여 저품질 감시 입력에 대한 강력한 일반화 능력을 입증한다.
  • 제거 실험 결과, 디코더(Dec)를 제거하면 성능 저하가 발생함을 확인하여, 정규화와 인식을 동시에 학습함으로써 특징 학습이 향상됨을 확인한다.
  • RSA 전략은 모델의 강건성을 크게 향상시키며, FAN-FT(RSA 포함)와 FAN-FT(RSA 제외)를 비교해 볼 때 랭크-1 정확도가 4.1% 향상됨을 입증한다.
  • FAN은 저해상도 입력에서 고품질로 신원을 유지하는 얼굴 이미지를 생성하며, SCface와 WIDER FACE에서의 정성적 비교를 통해 기존 SOTA FSR 기법 대비 더 나은 얼굴 세부 정보 복원 능력을 보였다.
  • FAN의 추론 속도(티탄 X GPU에서 특징 추출 0.011초, 이미지 복구 0.005초)는 FSRNet(0.012초)와 유사하며, CBN(3.84초)보다 훨씬 빠르며 실시간 감시 응용에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.