[논문 리뷰] Learning Robust Deep Face Representation
이 논문은 새로운 Max-Feature-Map (MFM) 활성화 함수를 도입한 얕은 딥 컨볼루션 네트워크를 제안하여 강건하고 컴팩트한 얼굴 표현을 학습한다. ReLU 대신 MFM를 사용함으로써 비영응답을 유지하고 희소 기울기를 가능하게 하여, 단일 네트워크로도 LFW 벤치마크에서 비지도 설정에서 97.77%의 정확도를 달성하며, DeepFace, DeepID2, WebFace를 모두 능가한다.
With the development of convolution neural network, more and more researchers focus their attention on the advantage of CNN for face recognition task. In this paper, we propose a deep convolution network for learning a robust face representation. The deep convolution net is constructed by 4 convolution layers, 4 max pooling layers and 2 fully connected layers, which totally contains about 4M parameters. The Max-Feature-Map activation function is used instead of ReLU because the ReLU might lead to the loss of information due to the sparsity while the Max-Feature-Map can get the compact and discriminative feature vectors. The model is trained on CASIA-WebFace dataset and evaluated on LFW dataset. The result on LFW achieves 97.77% on unsupervised setting for single net.
연구 동기 및 목표
- 희소 ReLU 활성화 함수로 인한 정보 손실을 방지하는 더 강건한 딥 얼굴 표현 학습 프레임워크를 개발하기 위해.
- 수동 임계값 설정과 하드 음성 마이닝이 필요한 검증 기반 손실 함수의 한계를 해결하기 위해.
- LFW에서의 감독적 피니팅 없이도 일반화 능력과 성능을 향상시키기 위해.
- 정보의 압축성을 유지하면서도 희소 기울기 업데이트를 가능하게 하는 대안적 활성화 함수를 탐색하기 위해.
- 단일 얕은 컨볼루션 네트워크로 LFW에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 모델은 약 400만 개의 파라미터를 가진 4개의 컨볼루션, 4개의 맥스 풀링, 2개의 완전 연결 레이어로 구성된 아키텍처를 사용한다.
- Max-Feature-Map (MFM) 활성화 함수는 쌍으로 이루어진 특징 맵 간의 최댓값을 계산한다: 각 공간 위치에서 $ f = \max(C^k, C^{k+n}) $.
- MFM의 기울기는 희소하다: $ \frac{\partial f}{\partial C^k} = 1 $ 이면 $ C^k \geq C^{k+n} $, 그렇지 않으면 0이며, 이는 희소 연결성을 가능하게 한다.
- MFM 함수는 각 컨볼루션 블록 이후에 적용되어 부산물 감소를 동시에 양산성 있는 특징 맵을 생성한다.
- 데이터 증강에는 128×128로의 무작위 크롭, 수평 반전, 완전 연결 레이어에 대한 드롭아웃(0.7)이 포함되어 과적합을 방지한다.
- 모델은 CASIA-WebFace(493,456장의 이미지, 10,575개의 개별 신원)에서 Caffe를 사용하여 훈련되며, 가중치 감쇠(대부분의 레이어에 대해 5e-4, 최종 레이어에 대해 5e-3)와 점차 감소하는 학습률(1e-3에서 5e-5로)을 적용한다.
실험 결과
연구 질문
- RQ1ReLU와 비교해 정보 손실가능성이 낮고 컴팩트한 비희소 활성화 함수가 딥 얼굴 표현 학습에 개선을 가져올 수 있는가?
- RQ2Max-Feature-Map 함수가 복잡한 손실 함수에 의존하지 않고도 얼굴 인식의 강건성과 성능을 향상시킬 수 있는가?
- RQ3비지도 훈련 하에서 얕은 단일 네트워크 아키텍처가 DeepFace나 DeepID2와 같은 깊은 모델보다 LFW 벤치마크에서 더 뛰어난 성능을 낼 수 있는가?
- RQ4훈련 중 수렴 속도와 최종 검증 정확도 측면에서 MFM는 ReLU보다 어떻게 다를 수 있는가?
- RQ5LFW에서의 피니팅 없이 MFM 기반 모델이 미리 보지 않은 신원에 대해 얼마나 잘 일반화되는가?
주요 결과
- 제안된 MFM 기반 모델은 비지도 설정에서 LFW 벤치마크에서 97.77%의 정확도를 달성하였으며, 이는 단일 네트워크 기준 최신 기술 수준이다.
- 비록 수렴 속도가 느리지만, MFM 활성화 함수는 검증 정확도에서 ReLU를 능가하여 더 나은 일반화와 강건성을 나타낸다.
- 단일 네트워크로도 DeepFace(비지도 설정에서 95.92%), DeepID2(비지도 설정에서 97.75%), WebFace(제한 없음에서 97.73%)를 모두 능가하는 성능을 달성한다.
- MFM 함수는 가장 활성화된 특징 맵 쌍을 선택함으로써 압축된 표현을 가능하게 하며, 비영응답을 유지함으로써 ReLU보다 정보 손실가능성을 낮춘다.
- 최종 완전 연결 레이어(fc2)에 대해 5e-3의 가중치 감쇠를 적용함으로써, 큰 파라미터 수로 인한 과적합을 완화할 수 있었다.
- 모델은 신원 간에 잘 일반화되어 있으며, LFW 데이터셋에서의 감독적 피니팅 없이도 뛰어난 성능을 발휘한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.