Skip to main content
QUICK REVIEW

[논문 리뷰] VIPLFaceNet: An Open Source Deep Face Recognition SDK

Xin Liu, Meina Kan|arXiv (Cornell University)|2016. 09. 13.
Face recognition and analysis참고 문헌 40인용 수 5
한 줄 요약

이 논문은 10층의 합성곱 신경망(7개의 합성곱층과 3개의 완전연결층)을 기반으로 한 오픈소스 딥 페이스 인식 SDK인 VIPLFaceNet을 소개한다. ReLU와 함께 빠른 정규화층(FNL)을 통합함으로써 학습 시간을 80% 감소시키고, LFW 벤치마크에서 평균 정확도 98.60%를 달성하여 AlexNet 대비 오차율 감소율 40%를 기록한다. 이는 단일 스레드 i7 CPU에서 이미지당 약 150ms의 낮은 추론 지연을 유지한다.

ABSTRACT

Robust face representation is imperative to highly accurate face recognition. In this work, we propose an open source face recognition method with deep representation named as VIPLFaceNet, which is a 10-layer deep convolutional neural network with 7 convolutional layers and 3 fully-connected layers. Compared with the well-known AlexNet, our VIPLFaceNet takes only 20% training time and 60% testing time, but achieves 40\% drop in error rate on the real-world face recognition benchmark LFW. Our VIPLFaceNet achieves 98.60% mean accuracy on LFW using one single network. An open-source C++ SDK based on VIPLFaceNet is released under BSD license. The SDK takes about 150ms to process one face image in a single thread on an i7 desktop CPU. VIPLFaceNet provides a state-of-the-art start point for both academic and industrial face recognition applications.

연구 동기 및 목표

  • 실세계 배포에 적합한 고정확도, 저계산량의 페이스 인식 시스템을 개발하기 위해.
  • 개인 내 변동성과 개인 간 유사성 문제를 다루는 데에 한계가 있는 수작업 특징 및 얕은 모델의 문제를 해결하기 위해.
  • 연구 및 산업적 도입을 가속화하기 위해 BSD 라이선스 하에 자유롭게 이용 가능한 오픈소스 SDK를 제공하기 위해.
  • 정확도를 희생시키지 않은 채 학습 시간을 단축하고 수렴 성능을 향상시키기 위해 딥 네트워크 아키텍처를 최적화하기 위해.
  • 순수 C++ 구현을 통해 다양한 소프트웨어 및 하드웨어 플랫폼에서 효율적인 배포를 가능하게 하기 위해.

제안 방법

  • 얼굴 표현을 최적화하기 위해 7개의 합성곱층과 3개의 완전연결층을 포함한 10층의 딥 합성곱 신경망을 설계하기 위해.
  • 학습의 안정성과 가속성을 향상시키기 위해 각 ReLU 활성화 함수 직후에 빠른 정규화층(FNL)을 도입하기 위해.
  • 일반화성과 강인성을 향상시키기 위해 다양한 크기의 무작위 자르기(180–256)를 활용한 데이터 증강을 적용하기 위해.
  • 확률적 경사 하강법를 사용하여 CASIA-WebFace 데이터셋을 기반으로 네트워크를 학습하고 기초 학습률을 0.04로 설정하기 위해.
  • FNL을 적용한 15에포크 학습 스케줄을 사용하여 총 학습 시간을 8시간(비FNL 기준 40시간 대비)으로 단축하기 위해.
  • 다양한 플랫폼 간 호환성과 CPU에서 저지연 추론을 가능하게 하기 위해 순수 C++ SDK를 통해 학습된 모델을 배포하기 위해.

실험 결과

연구 질문

  • RQ1단순화된 딥 CNN 아키텍처가 현저히 감소된 학습 시간으로 최신 기술 수준의 페이스 인식 정확도를 달성할 수 있는가?
  • RQ2빠른 정규화층(FNL)의 통합이 학습 수렴 속도와 모델 일반화에 어떤 영향을 미치는가?
  • RQ3LFW 벤치마크에서 정확도와 계산 효율성 측면에서 최적의 얼굴 입력 크기는 무엇인가?
  • RQ4경량 오픈소스 C++ SDK는 FaceNet이나 VGGFace와 같은 더 큰 복잡한 모델에 비해 어느 정도 성능을 유지할 수 있는가?
  • RQ5기존 방법들과 비교해 볼 때, VIPLFaceNet은 폐쇄세트 및 개방세트 페이스 인식 프로토콜에서 각각 어떤 성능을 보이는가?

주요 결과

  • 단일 네트워크를 사용하여 검증 프로토콜 하에서 LFW 벤치마크에서 98.60%의 평균 정확도를 달성한다.
  • 학습 시간을 80% 감소시켜 8시간으로 단축하고, 테스트 시간도 AlexNet 대비 60% 감소시키며 오차율을 40% 감소시킨다.
  • 최대 정확도를 얻기 위한 최적의 크기는 227×227이며, 이 경우 98.60%의 정확도를 기록하며 크기가 더 작거나 더 큰 경우 성능이 저하된다.
  • 빠른 정규화층(FNL)의 추가로 수렴 속도와 일반화 성능이 향상되어 고학습률에서도 15에포크 내에 수렴할 수 있다.
  • 폐쇄세트 인식 프로토콜에서 VIPLFaceNet은 랭크-1 정확도 92.79%와 FAR = 1%일 때 DIR 68.13%를 기록하여 DeepFace나 AlexNet+FNL과 같은 이전 방법들을 능가한다.
  • C++ SDK는 단일 스레드 i7 CPU에서 한 장의 얼굴 이미지를 약 150ms 내로 처리하여 실세계 응용에서의 효율적 배포를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.