[논문 리뷰] End-To-End Face Detection and Recognition
이 논문은 공간 변형 네트워크(STN)를 사용하여 얼굴 정렬을 위한 기하학적 변환을 직접 학습함으로써 별도의 랜드마크 예측이 필요 없도록 하는 엔드 투 엔드로 훈련 가능한 컨볼루션 네트워크를 제안한다. 검출 및 인식 간에 저수준 특징을 공유함으로써 FDDB에서 89.24%의 리콜과 LFW에서 98.63%의 정확도를 달성하여, 경계 상자 및 정체성 감독만으로도 최신 기술 수준의 성능을 달성한다.
Plenty of face detection and recognition methods have been proposed and got delightful results in decades. Common face recognition pipeline consists of: 1) face detection, 2) face alignment, 3) feature extraction, 4) similarity calculation, which are separated and independent from each other. The separated face analyzing stages lead the model redundant calculation and are hard for end-to-end training. In this paper, we proposed a novel end-to-end trainable convolutional network framework for face detection and recognition, in which a geometric transformation matrix was directly learned to align the faces, instead of predicting the facial landmarks. In training stage, our single CNN model is supervised only by face bounding boxes and personal identities, which are publicly available from WIDER FACE \cite{Yang2016} dataset and CASIA-WebFace \cite{Yi2014} dataset. Tested on Face Detection Dataset and Benchmark (FDDB) \cite{Jain2010} dataset and Labeled Face in the Wild (LFW) \cite{Huang2007} dataset, we have achieved 89.24\% recall for face detection task and 98.63\% verification accuracy for face recognition task simultaneously, which are comparable to state-of-the-art results.
연구 동기 및 목표
- 랜드마크 기반 정렬을 대체하여 기하학적 변환을 미분 가능한 방식으로 학습함으로써 별도의 얼굴 정렬 단계가 필요 없도록 하는 것.
- 검출 및 인식 간에 저수준 특징을 공유함으로써 검출 및 인식의 엔드 투 엔드 훈련을 가능하게 하는 것.
- 특징 공유를 통해 중복 계산을 줄임으로써 모델의 효율성과 성능을 향상시키는 것.
- 공개된 데이터에서만 이용 가능한 감독 신호인 경계 상자 및 정체성 레이블만을 사용하여 최신 기술 수준의 성능을 달성하는 것.
- 통합된 딥 러닝 프레임워크 내에서 STN 기반 정렬이 랜드마크 예측보다 더 유연하고 효과적임을 보여주는 것.
제안 방법
- 객체 검출을 위해 Faster R-CNN을 기반으로 하되, 컨볼루션 레이어 이후에 공간 변형 네트워크(STN)를 삽입하여 특징 맵 정렬을 위한 기하학적 변환을 학습한다.
- STN은 랜드마크 애너테이션 없이도 직접 변환 행렬을 예측하여 특징를 정렬함으로써 엔드 투 엔드 훈련이 가능하다.
- 검출 및 인식 브랜치는 VGG-16의 첫 번째 3~4개의 컨볼루션 블록을 공유하여 파라미터 수와 계산량을 감소시킨다.
- 모델는 WIDER FACE에서 제공하는 경계 상자와 CASIA-WebFace에서 제공하는 정체성 레이블만을 사용하여 엔드 투 엔드 훈련되며, 랜드마크 애너테이션의 필요성이 없다.
- 특징 공유의 효과를 체계적으로 평가하기 위해, 다양한 컨볼루션 레이어 이후에 인식 브랜치를 잘라 성능 상호 관계를 분석한다.
- 훈련 과정은 다단계 전략을 사용한다: 먼저 검출 모델을 사전 훈련하고, 그 다음 검출 및 인식을 함께 훈련하며, 마지막으로 인식 헤드를 미세 조정한다.
실험 결과
연구 질문
- RQ1공간 변형 네트워크(STN)가 엔드 투 엔드 얼굴 검출 및 인식 프레임워크 내에서 랜드마크 기반 정렬을 효과적으로 대체할 수 있는가?
- RQ2검출 및 인식 간에 저수준 특징을 공유하면 모델 성능과 훈련 효율성이 향상되는가?
- RQ3단일 CNN 모델이 경계 상자 및 정체성 감독만으로도 얼굴 검출 및 인식에서 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ4특징 공유의 깊이가 인식 정확도와 수렴 속도에 어떤 영향을 미치는가?
- RQ5제안된 엔드 투 엔드 프레임워크는 별도의 정렬 및 특징 추출 단계를 가진 전통적인 파ip라인보다 더 견고하고 정확한가?
주요 결과
- 모델은 FDDB 얼굴 검출 벤치마크에서 89.24%의 리콜을 달성하여 최신 기술 수준의 성능을 유지했다.
- 모델은 LFW 얼굴 인식 데이터셋에서 98.63%의 검증 정확도를 기록하여 기존의 단일 모델 접근 방식을 초월했다.
- 세 번째 컨볼루션 블록(conv3)에서 특징를 공유할 경우 가장 높은 인식 정확도를 기록했으며, LFW에서 98.63%의 정확도를 달성했다.
- 특징 공유로 인해 특히 깊은 특징를 공유할 경우 훈련 중 손실 수렴 속도가 빨라졌다.
- STN 기반 정렬 방법은 랜드마크 예측이 필요 없게 하여 파이프라인을 단순화하고 전체 엔드 투 엔드 훈련을 가능하게 했다.
- 공개된 데이터셋에서 경계 상자 및 정체성 레이블만을 사용하여도 높은 성능을 달성했으며, 추가 애너테이션 없이도 가능했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.