[논문 리뷰] An Automatic System for Unconstrained Video-Based Face Recognition
이 논문은 다중 척도 얼굴 검출, 품질 인식 얼굴 연관, 그리고 새로운 부분공간 간 유사도 측정법을 통합한 강건한 엔드 투 엔드 시스템을 제안한다. 이 시스템은 IJB-B 및 IJB-S 벤치마크에서 최신 기술 수준의 성능을 달성하며, FOCS에서 인간 수준의 정확도를 초월하고, 감시 영상에서 단일 영상로의 및 감시 영상에서 예약 영상으로의 프로토콜에서 ArcFace를 능가한다. 이는 품질 인식 부분공간 학습과 분산 인식 매칭을 통해 달성된다.
Although deep learning approaches have achieved performance surpassing humans for still image-based face recognition, unconstrained video-based face recognition is still a challenging task due to large volume of data to be processed and intra/inter-video variations on pose, illumination, occlusion, scene, blur, video quality, etc. In this work, we consider challenging scenarios for unconstrained video-based face recognition from multiple-shot videos and surveillance videos with low-quality frames. To handle these problems, we propose a robust and efficient system for unconstrained video-based face recognition, which is composed of modules for face/fiducial detection, face association, and face recognition. First, we use multi-scale single-shot face detectors to efficiently localize faces in videos. The detected faces are then grouped respectively through carefully designed face association methods, especially for multi-shot videos. Finally, the faces are recognized by the proposed face matcher based on an unsupervised subspace learning approach and a subspace-to-subspace similarity metric. Extensive experiments on challenging video datasets, such as Multiple Biometric Grand Challenge (MBGC), Face and Ocular Challenge Series (FOCS), IARPA Janus Surveillance Video Benchmark (IJB-S) for low-quality surveillance videos and IARPA JANUS Benchmark B (IJB-B) for multiple-shot videos, demonstrate that the proposed system can accurately detect and associate faces from unconstrained videos and effectively learn robust and discriminative features for recognition.
연구 동기 및 목표
- 자세, 조명, 흐림, 품질 등 다양한 영상 간 내·외부 변동성이 큰 비제약 영상 기반 얼굴 인식의 과제를 해결하기 위해.
- 높은 볼륨의 영상 데이터를 최소한의 인간 간섭으로 처리할 수 있는 확장성 있고 효율적인 시스템을 개발하기 위해.
- 얼굴 템플릿을 부분공간으로 모델링하고 품질 및 분산 인식 유사도 측정법을 사용하여 정확도를 향상시키기 위해.
- 특히 저품질 및 다중 촬영 조건에서 어려운 벤치마크인 IJB-B 및 IJB-S에서 기존 방법을 능가하기 위해.
제안 방법
- 비제약 영상에서 빠르고 정확한 얼굴 검출을 위해 다중 척도 단일 쇼트 검출기를 사용한다.
- 장면 및 시야 변화가 있는 다중 촬영 영상에서 특히 유사한 얼굴을 그룹화하기 위해 맞춤형 얼굴 연관 전략을 사용한다.
- 표본 간 상관관계를 캡처하기 위해 비지도 부분공간 학습을 통해 저차원 부분공간으로 얼굴 템플릿을 표현한다.
- 템플릿 표현 동안 고품질 프레임에 더 높은 가중치를 할당하는 품질 인식 예시 구성 방법을 도입한다.
- 외관 변화에 대한 강건성을 향상시키기 위해 부분공간 간 유사도를 계산하기 위해 분산 인식 투영 거리(VPM)를 적용한다.
- 품질 인식 코사인 거리, 품질 인식 부분공간 학습, 분산 인식 투영 거리를 통합한 유사도 측정법(QCos+QSub-VPM)을 구성한다.
실험 결과
연구 질문
- RQ1품질 인식 부분공간 표현이 저품질 및 비제약 영상 환경에서 얼굴 인식 성능을 향상시킬 수 있는가?
- RQ2부분공간 유사도 측정법에 분산 정보를 통합할 경우 다양한 영상 조건에서 인식의 강건성에 어떤 영향을 미치는가?
- RQ3다중 촬영 및 감시 영상에서 얼굴 연관 정확도가 전체 인식 성능에 미치는 영향은 어느 정도인가?
- RQ4제안된 부분공간 간 유사도 측정법이 개방 집합 영상 얼굴 식별에서 기존의 예시 기반 또는 임bedding 기반 매칭을 능가하는가?
- RQ5시스템이 개방 집합 식별 프로토콜 하에서 도전적인 영상 벤치마크인 FOCS에서 인간 수준의 성능을 초월할 수 있는가?
주요 결과
- 제안된 시스템은 IJB-B 및 IJB-S 벤치마크에서 최신 기술 수준의 성능을 달성하며, 모든 프로토콜에서 순위-1 정확도가 크게 향상되었다.
- IJB-S 감시 영상에서 감시 영상 프로토콜에서 시스템은 고해상도 갤러리 프로토콜에서 ArcFace를 능가했으며, 품질 인식 매칭을 통해 일관된 성능 향상을 보였다.
- 제거 실험 결과, 각 구성 요소인 품질 인식 예시, 부분공간 학습, 분산 인식 측정법이 점진적으로 성능 향상에 기여하는 것으로 확인되었다.
- 시스템은 FOCS 데이터셋에서 인간 수준의 성능을 초월하여 강건성과 분류 능력을 입증했다.
- 네트워크 D와 E의 융합은 감시 영상에서 감시 영상 프로토콜에서 성능 향상을 이끌지 못했으며, 이는 저품질 갤러리 템플릿 표현이 열악하기 때문일 것이다.
- 제안된 QCos+QSub-VPM 유사도 측정법은 ArcFace 특징을 포함한 모든 데이터셋 및 특징 유형에서 기준 방법 대비 일관되게 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.