Skip to main content
QUICK REVIEW

[논문 리뷰] GhostVLAD for set-based face recognition

Yujie Zhong, Relja Arandjelović|arXiv (Cornell University)|2018. 10. 23.
Face recognition and analysis참고 문헌 38인용 수 5
한 줄 요약

이 논문은 집합 기반 얼굴 인식 성능을 향상시키기 위해 얼굴 기술자를 고정된 길이의 압축 표현으로 집계하는 데 중점을 두고, '기타 클러스터'를 도입하여 저품질 이미지가 집계에 기여하지 않도록 하면서도, 저품질 입력을 자동으로 가중치를 낮추는 새로운 신경망 레이어인 GhostVLAD을 제안한다. 이는 IJB-B 및 IJB-A에서 128차원 템플릿을 사용하여 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

The objective of this paper is to learn a compact representation of image sets for template-based face recognition. We make the following contributions: first, we propose a network architecture which aggregates and embeds the face descriptors produced by deep convolutional neural networks into a compact fixed-length representation. This compact representation requires minimal memory storage and enables efficient similarity computation. Second, we propose a novel GhostVLAD layer that includes {\em ghost clusters}, that do not contribute to the aggregation. We show that a quality weighting on the input faces emerges automatically such that informative images contribute more than those with low quality, and that the ghost clusters enhance the network's ability to deal with poor quality images. Third, we explore how input feature dimension, number of clusters and different training techniques affect the recognition performance. Given this analysis, we train a network that far exceeds the state-of-the-art on the IJB-B face recognition dataset. This is currently one of the most challenging public benchmarks, and we surpass the state-of-the-art on both the identification and verification protocols.

연구 동기 및 목표

  • 이미지 품질이 크게 변동하는 비제약 환경에서 템플릿 기반 얼굴 인식의 과제를 해결한다.
  • 유사도 계산을 효율적으로 수행하고 메모리 사용을 최소화할 수 있도록 이미지 집합의 압축된 고정 길이 표현을 개발한다.
  • 정보가 풍부한 얼굴을 더 높은 가중치로 부여함으로써 템플릿 기술자의 분류 성능을 향상시킨다.
  • 명시적 지도 없이도 정보가 없는 또는 노이즈가 많은 얼굴 이미지를 자동으로 낮은 가중치로 처리할 수 있는 메커니즘을 설계한다.
  • 정체성 수준의 레이블만을 사용하여 도전적인 IJB-B 및 IJB-A 벤치마크에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • NetVLAD를 확장하여 '기타 클러스터'—소프트 할당을 받지만 최종 기술자 집계에 기여하지 않는 클러스터—를 도입한 GhostVLAD 레이어를 제안한다.
  • 각 클러스터의 잔차에서 계산된 잔차 벡터를 할당 확률로 가중하여 최종 압축된 기술자를 구성한다.
  • 정체성 수준의 레이블만을 사용하여 네트워크를 엔드 투 엔드로 훈련함으로써, 품질에 따라 얼굴 중요도를 자동으로 학습한다.
  • MS-Celeb-1M에서 사전 훈련하고 VGGFace2에서 미세조정한 ResNet 기반 백본(예: SE-ResNet-50)에 GhostVLAD를 통합한다.
  • 각 입력 이미지가 최종 템플릿에 기여하는 정도를 잔차 벡터의 노름을 통해 측정함으로써 학습된 주의 메커니즘의 시각화를 가능하게 한다.
  • 표준 벤치마크 IJB-A 및 IJB-B를 사용하여 검증(ROC) 및 식별(DET) 성능을 동시에 최적화한다.

실험 결과

연구 질문

  • RQ1딥 러닝 아키텍처는 명시적 지도 없이도 저품질 얼굴 이미지의 중요도를 자동으로 낮출 수 있는가?
  • RQ2기타 클러스터의 포함 여부가 얼굴 인식에서 템플릿 표현의 분류 성능와 내성에 어떤 영향을 미치는가?
  • RQ3입력 특징 차원, 클러스터 수, 훈련 기법이 집합 기반 얼굴 인식의 성능에 어떤 영향을 미치는가?
  • RQ4압축된 128차원 템플릿 표현이 정확도와 효율성 측면에서 더 큰 2048차원 표현을 능가할 수 있는가?
  • RQ5제안된 방법은 가장 도전적인 공개 벤치마크인 IJB-B 및 IJB-A에서 최신 기술 수준의 성능을 달성하는가?

주요 결과

  • IJB-B 검증 작업에서 GhostVLAD 네트워크는 FAR=1e-5일 때 TAR가 0.762를 기록하여 이전 SOTA인 0.705를 초월한다.
  • IJB-B 식별 작업에서 네트워크는 FPIR=0.01일 때 TPIR가 0.776을 기록하여 이전 SOTA인 0.743을 능가한다.
  • MS-Celeb-1M을 사용하지 않고 VGGFace2에서만 훈련한 경우에도, IJB-B에서 FAR=1e-5일 때 TAR가 0.762를 기록하며, 이는 이전 SOTA의 0.671보다 높다.
  • 네트워크는 128차원 템플릿을 생성하여 이전 SOTA 방법의 2048-D 템플릿보다 훨씬 작아져 더 빠른 추론과 낮은 메모리 사용을 가능하게 한다.
  • 정성적 분석 결과 기타 클러스터가 흐린 이미지나 해상도가 낮은 이미지의 기여도를 감소시켜 신호 대 노이즈 비율을 향상시킨다.
  • 더 깊은 ResNet 기반 방법 [44]에 비해 더 浅은 백본과 더 작은 템플릿 크기를 사용함에도 불구하고, IJB-A 검증에서 성능을 뛰어넘는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.