[논문 리뷰] AirFace: Lightweight and Efficient Model for Face Recognition
이 논문은 새로운 손실 함수인 Li-ArcFace와 주목사용 모듈 및 훈련 최적화를 통합한 향상된 MobileFaceNet 아키텍처를 갖춘 경량이고 효율적인 얼굴 인식 모델인 AirFace를 제안한다. Li-ArcFace는 원래 ArcFace의余弦 기반 마진을 선형 함수로 대체하여 작은 임bedding 크기(예: 128D)에서 수렴성을 향상시키며, 사전 훈련 없이 엔드 투 엔드 훈련이 가능하고, LFR2019 및 MegaFace Challenge 1에서 최고 성능을 기록한다.
With the development of convolutional neural network, significant progress has been made in computer vision tasks. However, the commonly used loss function softmax loss and highly efficient network architecture for common visual tasks are not as effective for face recognition. In this paper, we propose a novel loss function named Li-ArcFace based on ArcFace. Li-ArcFace takes the value of the angle through linear function as the target logit rather than through cosine function, which has better convergence and performance on low dimensional embedding feature learning for face recognition. In terms of network architecture, we improved the the perfomance of MobileFaceNet by increasing the network depth, width and adding attention module. Besides, we found some useful training tricks for face recognition. With all the above results, we won the second place in the deepglint-light challenge of LFR2019.
연구 동기 및 목표
- 128D와 같은 작은 임베딩 크기의 모델을 처음부터 훈련할 때 ArcFace의 낮은 수렴성 문제를 해결한다.
- 네트워크 아키텍처와 훈련 절차를 최적화하여 모바일 디바이스에서의 얼굴 인식 성능을 향상시킨다.
- 사전 훈련이 필요 없이도 클래스 간 분離성과 클래스 내 밀도를 향상시키는 손실 함수를 개발한다.
- DeepGlint-Light Challenge 2019와 같은 자원이 제한된 환경에서 최고 성능을 달성한다.
- 효율적인 네트워크 설계와 훈련 기법이 얼굴 인식 벤치마크에서 성능을 크게 향상시킬 수 있음을 입증한다.
제안 방법
- ArcFace의 코사인 기반 각도 마진을 각도의 선형 함수로 대체하여 훈련 안정성과 수렴성을 향상시키는 새로운 추가 마진 손실 함수인 Li-ArcFace를 제안한다.
- 네트워크 깊이와 너비를 증가시키고, 특징 표현을 향상시키기 위해 압축-해방(SE) 주목사용 모듈을 통합하여 MobileFaceNet을 개선한다.
- 최종 임베딩 레이어를 제외한 모든 레이어에 대해 5e-4의 가중치 감쇠 배수를 적용하고, 최종 레이어에는 5e-3을 사용하여 최적화 안정성을 향상시킨다.
- Li-ArcFace에서 마진 초항수 m은 0.4에서 0.45 사이로 조정되며, 최적 성능는 m=0.4에서 달성된다.
- MS1M-retina 데이터셋과 InsightFace의 얼굴 검출 및 정렬 파이프라인을 사용하여 데이터 전처리를 수행한다.
- SGD와 모멘텀을 사용하여 엔드 투 엔드로 모델을 훈련하고, LFW, CFP-FP, AgeDB 및 MegaFace Challenge 1과 같은 표준 벤치마크에서 평가한다.
실험 결과
연구 질문
- RQ1작은 임베딩 크기의 모델(예: 128D)을 처음부터 훈련할 때 수정된 손실 함수가 수렴성과 성능을 향상시킬 수 있는가?
- RQ2Li-ArcFace 손실 함수는 낮은 차원의 얼굴 임베딩에서 ArcFace 및 CosFace와 비교해 수렴성과 정확도 측면에서 어떻게 성능을 내는가?
- RQ3MobileFaceNet의 아키텍처 개선이 계산 비용을 증가시키지 않으면서 얼굴 인식 정확도를 얼마나 향상시킬 수 있는가?
- RQ4어떤 훈련 기법이 경량 얼굴 인식 모델의 성능을 크게 향상시키는가?
- RQ5경량 모델이 MegaFace Challenge 1 및 DeepGlint-Light Challenge 2019와 같은 주요 벤치마크에서 최고 성능을 달성할 수 있는가?
주요 결과
- Li-ArcFace는 LFW에서 99.27%의 검증 정확도, CFP-FP에서 94.20%, AgeDB에서 93.25%를 기록하여 대부분의 설정에서 ArcFace와 CosFace를 초월했다.
- DeepGlint-Light Challenge 2019에서 AirFace는 1e-8 FPR에서 88.415%의 검증 정확도를 기록하여 2위를 차지했다.
- MegaFace Challenge 1에서 AirFace는 1e-6 FAR에서 97.93%의 TAR를 달성했으며, FLOPs는 1G에 불과하여 MobileFaceNet을 초월하고 더 큰 모델과도 맞먹는 성능을 보였다.
- Li-ArcFace는 작은 임베딩 크기에서 ArcFace보다 더 좋은 수렴성을 보였으며, 소프트맥스 손실을 통한 사전 훈련이 필요 없어졌다.
- 주목사용 모듈과 아키텍처 개선을 적용한 모델은 표준 MobileFaceNet 대비 AgeDB에서 성능이 6% 이상 향상되었다.
- Li-ArcFace의 최적 마진 초항수는 m=0.4로 확인되었으며, m=0.5 이상일 경우 성능이 약간 저하되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.