[논문 리뷰] Deep Face Recognition Model Compression via Knowledge Transfer and Distillation
이 논문은 프루닝이나 양자화 없이 고해상도의 교사 네트워크가 저해상도의 학생 네트워크를 안내하는 지식 전이 및 정수 기반 모델 압축 방법을 제안한다. 이 방법은 IJB-C에서 최신 기술 수준의 성능을 달성하며, 훈련 속도, 추론 속도, 메모리 효율성, 정확도 측면에서 최대 4배 향상되어 자원 제약이 있는 장치에 배포가 가능하다.
Fully convolutional networks (FCNs) have become de facto tool to achieve very high-level performance for many vision and non-vision tasks in general and face recognition in particular. Such high-level accuracies are normally obtained by very deep networks or their ensemble. However, deploying such high performing models to resource constraint devices or real-time applications is challenging. In this paper, we present a novel model compression approach based on student-teacher paradigm for face recognition applications. The proposed approach consists of training teacher FCN at bigger image resolution while student FCNs are trained at lower image resolutions than that of teacher FCN. We explored three different approaches to train student FCNs: knowledge transfer (KT), knowledge distillation (KD) and their combination. Experimental evaluation on LFW and IJB-C datasets demonstrate comparable improvements in accuracies with these approaches. Training low-resolution student FCNs from higher resolution teacher offer fourfold advantage of accelerated training, accelerated inference, reduced memory requirements and improved accuracies. We evaluated all models on IJB-C dataset and achieved state-of-the-art results on this benchmark. The teacher network and some student networks even achieved Top-1 performance on IJB-C dataset. The proposed approach is simple and hardware friendly, thus enables the deployment of high performing face recognition deep models to resource constraint devices.
연구 동기 및 목표
- 모델 크기와 계산 요구 사항이 크기 때문에 고정확도의 딥 얼굴 인식 모델을 자원 제약이 있는 장치에 배포하는 데 도전하는 문제를 해결한다.
- 프루닝, 양자화, 아키텍처 변경에 의존하는 기존 압축 기법의 한계를 극복한다.
- 학생 네트워크가 교사보다 낮은 해상도에서 훈련되며, 지식 전이와 정수를 활용하는 새로운 학생-교사 프레임워크를 탐색한다.
- 네트워크 아키텍처를 수정하거나 모델 파라미터를 줄이지 않고도 정확도와 효율성을 향상시킨다.
- 하드웨어 우수한 압축을 통해 고성능 얼굴 인식 모델을 엣지 장치에 실용적으로 배포할 수 있도록 한다.
제안 방법
- 풍부한 특징을 캡처하기 위해 더 높은 입력 해상도(예: 112×112)에서 전체 컨volutional 네트워크(FCN)를 훈련시킨다.
- 교사와 동일한 아키텍처를 공유하면서 점차 낮아지는 해상도(예: 48×48에서 112×112까지)에서 학생 FCN을 훈련시킨다.
- 훈련 중에 교사의 레이어 파라미터를 학생으로 전이함으로써 지식 전이(KT)를 적용한다.
- 교사에서 소프트 레이블 확률과 중간 레이어 표현을 학생으로 전이함으로써 지식 정수(KD)를 적용한다.
- KT와 KD를 결합하여 학생 네트워크를 함께 훈련시켜, 초기 훈련보다 성능을 향상시킨다.
- 얼굴 검출에 MTCNN을 사용하고, 평균 특징 풀링을 적용하여 특징 표현 품질을 향상시킨다.
실험 결과
연구 질문
- RQ1고해상도의 교사 네트워크에서 유도된 지식 전이 및 정수화가 저해상도의 학생 네트워크 성능을 향상시킬 수 있는가?
- RQ2고해상도의 교사에서 유도된 지식을 활용하면서도 저해상도에서 학생 네트워크를 훈련시키면 정확도 손실 없이 훈련 및 추론 속도가 향상되는가?
- RQ3이러한 방법을 통해 아키텍처 수정 없이도 IJB-C와 같은 벤치마크 데이터셋에서 최신 기술 수준의 정확도를 달성할 수 있는가?
- RQ4이 방법을 사용해 딥 얼굴 인식 모델을 압축할 경우, 모델 크기, 추론 속도, 정확도 사이의 상호 상충 관계는 어떻게 되는가?
- RQ5다양한 입력 해상도에서 지식 전이와 정수화의 조합이 학생 네트워크 성능 향상에 얼마나 효과적인가?
주요 결과
- 96×96 및 80×80 해상도에서 지식 전이(KT)를 적용한 학생 네트워크는 IJB-C 1:1 혼합 검증 프로토콜에서 Top-1 정확도를 달성했다.
- 80×80 해상도의 학생 네트워크는 교사 대비 CPU 추론 시간을 51% 감소시키고, MACC 연산을 49% 줄였으며, 유사한 정확도를 유지했다.
- IJB-C 1:1 검증 프로토콜에서 10⁻⁴ FAR 조건에서 KT는 정확도를 95.89% (KT 없음)에서 96.05%로 향상시켰다 (96×96 해상도 기준).
- 48×48 해상도에서 KT는 10⁻⁴ FAR 조건에서 1:1 검증 정확도를 91.74%에서 93.94%로 향상시켜 저해상도에서의 상당한 성능 향상을 보였다.
- 모든 학생 네트워크는 IJB-C 1:1 검증 및 1:N 식별 프로토콜에서 최신 기술 수준의 결과를 달성했으며, 교사 네트워크 역시 Top-1 성능을 달성했다.
- 이 방법은 아키텍처 수정 없이도 파라미터 양자화 없이도 훈련 속도, 추론 속도, 메모리 사용량 감소, 정확도 향상 측면에서 4배의 우수성을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.