Skip to main content
QUICK REVIEW

[논문 리뷰] Large-scale Supervised Hierarchical Feature Learning for Face Recognition

Jianguo Li, Yurong Chen|arXiv (Cornell University)|2014. 07. 06.
Face and Expression Recognition참고 문헌 27인용 수 3
한 줄 요약

이 논문은 세 단계로 구성된 대규모 지도형 계층적 특징 학습 프레임워크를 제안한다: 가우시안 수용장에 기반한 채널 수준의 선택, 과잉완전한 풀에서의 패치 수준의 선택, 그리고 패치 기술자의 판별 하위공간 투영. 이 방법은 FRGC 및 LFW 벤치마크에서 최신 기술 수준의 성능을 달성하며, 낮은 메모리 및 계산 비용을 유지하여 임베디드 시스템에의 구현을 가능하게 한다.

ABSTRACT

This paper proposes a novel face recognition algorithm based on large-scale supervised hierarchical feature learning. The approach consists of two parts: hierarchical feature learning and large-scale model learning. The hierarchical feature learning searches feature in three levels of granularity in a supervised way. First, face images are modeled by receptive field theory, and the representation is an image with many channels of Gaussian receptive maps. We activate a few most distinguish channels by supervised learning. Second, the face image is further represented by patches of picked channels, and we search from the over-complete patch pool to activate only those most discriminant patches. Third, the feature descriptor of each patch is further projected to lower dimension subspace with discriminant subspace analysis. Learned feature of activated patches are concatenated to get a full face representation.A linear classifier is learned to separate face pairs from same subjects and different subjects. As the number of face pairs are extremely large, we introduce ADMM (alternative direction method of multipliers) to train the linear classifier on a computing cluster. Experiments show that more training samples will bring notable accuracy improvement. We conduct experiments on FRGC and LFW. Results show that the proposed approach outperforms existing algorithms under the same protocol notably. Besides, the proposed approach is small in memory footprint, and low in computing cost, which makes it suitable for embedded applications.

연구 동기 및 목표

  • 자원 제약이 있는 모바일 및 임베디드 장치를 위한 경량이고 견고한 얼굴 인식 알고리즘 개발의 과제를 해결한다.
  • 비지도 또는 수작업으로 설계된 특징 학습의 한계를 극복하기 위해 완전히 지도형의 계층적 특징 학습 파이프라인을 도입한다.
  • 대규모 지도형 학습이 기준 벤치마크 데이터셋에서 인식 정확도를 크게 향상시킨다는 것을 입증한다.
  • 실제 구현을 위한 저비용 계산 및 메모리 오버헤드를 유지하면서도 높은 성능을 달성한다.

제안 방법

  • 수용장 이론을 기반으로 얼굴 이미지를 모델링하여, 다중 채널 가우시안 수용장 맵으로 표현하고, 지도형 학습을 통해 가장 판별력 있는 채널만 선택한다.
  • 선택된 채널에서 패치를 추출하고, 과잉완전한 패치 풀 검색을 수행하여 지도형 기준에 따라 가장 판별력 있는 패치를 식별한다.
  • 각 선택된 패치의 기술자 정보를 판별 하위공간 분석(LDA)을 사용해 저차원 하위공간으로 투영하여 판별력을 향상시킨다.
  • 모든 선택된 패치로부터 학습된 특징을 연결하여 완전한 얼굴 표현을 구성한다.
  • ADMM(교차 방향 다중승수 방법)를 사용해 대규모 얼굴 쌍 데이터에서 선형 분류기를 훈련하여 컴퓨팅 클러스터에 걸쳐 훈련을 확장한다.
  • FRGC 및 LFW 벤치마크에서 엄격한 프rotocol에 따라 프레임워크를 적용하고, 교차 검증 및 대규모 데이터를 활용해 정확도를 확보한다.

실험 결과

연구 질문

  • RQ1완전히 지도형의 계층적 특징 학습 프레임워크가 기존의 수작업 또는 비지도 특징 학습 방법보다 얼굴 인식 성능에서 뛰어나게 되는가?
  • RQ2분산 클러스터에서의 대규모 학습이 표준 기준 벤치마크에서 인식 정확도를 크게 향상시키는가?
  • RQ3제안된 방법이 임베디드 장치에의 구현을 위해 낮은 메모리 사용량과 낮은 계산 비용을 유지하면서도 높은 정확도를 유지를 할 수 있는가?
  • RQ4채널, 패치, 기술자 수준을 아우르는 계층적 특징 학습 파이프라인은 어떻게 판별력을 향상시키는가?

주요 결과

  • FRGC-204 벤치마크에서 0.1%의 가짜 양성률에서 92.6%의 참양성률을 기록하여, 표 2에 나열된 모든 이전 방법들을 능가한다.
  • 이미지 제한, 외부 데이터 없음 레이블 프로토콜 하에서 LFW 벤치마크에서 91.54%의 정확도(표준 오차 ±0.49%)를 달성하여 기존 최신 기술 수준의 접근법을 초월한다.
  • Gabor 기반 방법보다 특징 추출 속도가 약 10배 빠르며, 이는 실시간 응용에 매우 중요하다.
  • 시스템은 낮은 메모리 사용량과 낮은 계산 비용을 유지하여 임베디드 및 모바일 장치에의 구현에 적합하다.
  • 실험 결과, 훈련 샘플 수를 늘릴수록 정확도 향상이 뚜렷하게 관찰되어 대규모 지도형 학습의 이점이 입증된다.
  • 채널 선택, 패치 선택, LDA 투영을 포함한 계층적 설계가 다양한 해상도에서 판별력 있는 특징을 효과적으로 포착한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.