Skip to main content
QUICK REVIEW

[논문 리뷰] VarGFaceNet: An Efficient Variable Group Convolutional Neural Network for Lightweight Face Recognition

Mengjia Yan, Mengao Zhao|arXiv (Cornell University)|2019. 10. 11.
Face recognition and analysis참고 문헌 23인용 수 6
한 줄 요약

VarGFaceNet는 계산 효율성과 특징 구분 능력의 균형을 맞추기 위해 가변 그룹 컨볼루션을 활용하는 경량 얼굴 인식 네트워크이다. 전용 헤드 설정과 채널 확장 및 파arameter 효율적인 컨벌루션을 갖춘 임bedding 블록을 도입함으로써, 1G FLOPs 이하 및 20MB 이내 메모리에서 LFR 2019 챌린지에서 최신 기술 수준 성능을 달성하였으며, 이는 이전 작업 대비 TPR@FPR=1e-8에서 5% 높은 성능이다.

ABSTRACT

To improve the discriminative and generalization ability of lightweight network for face recognition, we propose an efficient variable group convolutional network called VarGFaceNet. Variable group convolution is introduced by VarGNet to solve the conflict between small computational cost and the unbalance of computational intensity inside a block. We employ variable group convolution to design our network which can support large scale face identification while reduce computational cost and parameters. Specifically, we use a head setting to reserve essential information at the start of the network and propose a particular embedding setting to reduce parameters of fully-connected layer for embedding. To enhance interpretation ability, we employ an equivalence of angular distillation loss to guide our lightweight network and we apply recursive knowledge distillation to relieve the discrepancy between the teacher model and the student model. The champion of deepglint-light track of LFR (2019) challenge demonstrates the effectiveness of our model and approach. Implementation of VarGFaceNet will be released at https://github.com/zma-c-137/VarGFaceNet soon.

연구 동기 및 목표

  • 엄격한 계산 제약 조건 하에서 경량 얼굴 인식 네트워크의 구분 능력과 일반화 능력을 향상시키기 위해.
  • 잔차 블록 내에서 계산 강도의 불균형을 해결하기 위해 가변 그룹 컨볼루션을 도입하기 위해.
  • 네트워크 시작 시 다운샘플링을 방지하기 위해 헤드 설정을 수정함으로써 초기 레이어에서 중요한 얼굴 세부 정보를 유지하기 위해.
  • 새로운 임bedding 블록 설계를 통해 완전 연결 계층의 파라미터를 줄이면서도 구분 능력을 유지하기 위해.
  • 효율적인 각도 기반 디스틸레이션 손실과 순환적 지식 디스틸레이션을 통해 모델의 해석 가능성과 성능을 향상시키기 위해.

제안 방법

  • 각 레이어별로 채널 그룹을 동적으로 조정할 수 있는 가변 그룹 컨볼루션을 도입하여 계산 효율성과 특징 표현 능력을 향상시킨다.
  • 첫 번째 컨볼루션 레이어에서 다운샘플링을 생략하는 수정된 헤드 설정을 적용하여 고해상도 얼굴 특징을 유지한다.
  • 채널을 320에서 1024로 확장한 후 가변 그룹 컨볼루션과 포인트와이즈 컨볼루션을 적용하는 커스터마이즈된 임bedding 블록을 설계한다.
  • 교수 모델의 각도 마진 정보를 활용하여 학생 네트워크를 지도하는 등가 각도 기반 디스틸레이션 손실을 적용한다.
  • 각 학생 모델이 다음 세대의 교수 모델이 되는 순환적 지식 디스틸레이션을 사용하여 분포 차이를 줄인다.
  • ArcFace 손실을 사용하여 네트워크를 훈련하고, LFW, CFP-FP, AgeDB-30, 그리고 DeepGlint-Light와 같은 표준 벤치마크에서 성능을 검증한다.

실험 결과

연구 질문

  • RQ1가변 그룹 컨볼루션은 경량 얼굴 인식 네트워크에서 성능 대 효율성의 균형을 향상시킬 수 있는가?
  • RQ2초기 특징 해상도를 유지하는 수정된 헤드 설정은 대규모 얼굴 데이터셋에서 인식 정확도에 어떤 영향을 미치는가?
  • RQ3채널 확장과 파라미터 효율적인 컨볼루션을 갖춘 커스터마이즈된 임bedding 블록은 구분 능력을 훼손하지 않으면서 모델 크기를 얼마나 줄일 수 있는가?
  • RQ4등가 각도 기반 디스틸레이션 손실은 경량 학생 네트워크의 보다 우수한 일반화를 이끌어내는 데 얼마나 효과적인가?
  • RQ5학생 모델과 교수 모델 간의 아키텍처 격차가 클 경우 순환적 지식 디스틸레이션은 성능 향상에 상당한 기여를 하는가?

주요 결과

  • VarGFaceNet는 동일한 1G FLOPs 및 20MB 메모리 제약 조건 하에서, 이전 최신 기술 수준 모델 대비 DeepGlint-Light 테스트 세트에서 TPR@FPR=1e-8가 5% 높은 성능을 달성하였다.
  • 채널 용량이 더 높음에도 불구하고, AgeDB-30에서 0.6% 향상된 검증 정확도와 CFP-FP에서 0.2% 향상된 성능를 기록하였다.
  • 제안된 임bedding 블록은 완전 연결 계층의 파라미터를 줄이면서도 구분 능력을 유지하여, MobileFaceNet의 7×7 디프웨이즈 컨볼루션 방식을 능가하는 성능을 보였다.
  • 순환적 지식 디스틸레이션은 LFW와 CFP-FP에서 각각 0.1% 향상된 검증 정확도를, DeepGlint-Light에서 TPR@FPR=1e-8가 0.4% 향상된 성능를 기록하였다.
  • 모델 성능은 교수 모델의 품질과 매우 높은 상관관계를 보이며, 더 강력한 교수 모델이 더 우수한 학생 일반화를 이끌어낸다.
  • 절단 실험 결과, 헤드 설정과 임bedding 블록 설계가 핵심임을 확인하였으며, 표준 설정을 사용한 순수 VarGNet은 모든 벤치마크에서 VarGFaceNet에 뒤지지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.