Skip to main content
QUICK REVIEW

[논문 리뷰] Recurrent Embedding Aggregation Network for Video Face Recognition

Sixue Gong, Yichun Shi|arXiv (Cornell University)|2019. 04. 26.
Face recognition and analysis참고 문헌 49인용 수 16
한 줄 요약

이 논문은 IJB-S, YTF, PaSC 데이터셋에서 CNN-LSTM 및 품질 인식 기반 집합 방법보다 우수한 성능을 내며, 노이즈가 많은 프레임에 대해 강건성을 향상시키기 위해 사전 훈련된 깊이 있는 얼굴 임베딩을 LSTMs를 통한 맥락 인식 주의 메커니즘을 활용해 집약하는 Recurrent Embedding Aggregation Network(REAN)을 제안한다. 이는 분류 가능한 특징을 효과적으로 유지하면서 노이즈를 억제함으로써 성능을 향상시킨다.

ABSTRACT

Recurrent networks have been successful in analyzing temporal data and have been widely used for video analysis. However, for video face recognition, where the base CNNs trained on large-scale data already provide discriminative features, using Long Short-Term Memory (LSTM), a popular recurrent network, for feature learning could lead to overfitting and degrade the performance instead. We propose a Recurrent Embedding Aggregation Network (REAN) for set to set face recognition. Compared with LSTM, REAN is robust against overfitting because it only learns how to aggregate the pre-trained embeddings rather than learning representations from scratch. Compared with quality-aware aggregation methods, REAN can take advantage of the context information to circumvent the noise introduced by redundant video frames. Empirical results on three public domain video face recognition datasets, IJB-S, YTF, and PaSC show that the proposed REAN significantly outperforms naive CNN-LSTM structure and quality-aware aggregation methods.

연구 동기 및 목표

  • 감시 영상에서의 노이즈가 많고 품질이 낮은 영상 프레임 문제를 해결하기 위해.
  • 딥 페처 추출기를 다시 훈련하지 않고도 영상 시퀀스의 시간적 맥락을 활용해 인식 정확도를 향상시키기 위해.
  • 품질 평가와 맥락 인식을 결합한 강건한 집약 메커니즘을 개발하여 더 나은 특징 표현을 얻기 위해.
  • 평균 풀링 및 품질 인식 모델을 포함한 기존 집약 방법보다 표준 영상 얼굴 인식 벤치마크에서 승리하기 위해.

제안 방법

  • REAN은 엔드 투 엔드 훈련을 피하기 위해 사전 훈련된 CNN을 사용해 각 영상 프레임에서 깊이 있는 얼굴 임베딩을 추출한다.
  • LSTM 네트워크가 임베딩 시퀀스를 처리하여 시간적 의존성에 기반한 맥락 인식 표현을 학습한다.
  • LSTM은 프레임 간의 관련성과 품질에 따라 임베딩를 동적으로 가중치 부여하는 주의 점수를 생성한다.
  • 최종 영상 수준의 표현은 LSTM에서 유도된 주의 점수를 사용해 임베딩의 가중치 집약을 통해 형성되며, 압축되고 분류 가능한 벡터를 생성한다.
  • 품질 인식 주의 메커니즘을 LSTM 프레임워크에 통합해 정보가 많은 프레임을 우선시하고 노이즈가 많거나 품질이 낮은 프레임을 억제한다.
  • 이미지(예: IJB-S에서)의 경우, 품질 예측이 고품질 이미지에서 덜 신뢰도가 떨어지므로 분포 이탈을 방지하기 위해 REAN 대신 평균 풀링을 사용한다.

실험 결과

연구 질문

  • RQ1예측된 얼굴 임베딩을 시간적 맥락에 따라 집약하는 데에 순환 네트워크를 사용할 수 있는가? 이는 노이즈가 많은 영상 프레임에 대해 강건성을 향상시키는가?
  • RQ2임베딩 집약에 맥락 인식 주의를 통합하면 품질 전용 또는 평균 풀링 방법보다 성능이 향상되는가?
  • RQ3REAN은 감시 및 제약 조건이 없는 영상 데이터를 포함한 다양한 영상 얼굴 인식 벤치마크에서 효과적으로 일반화되는가?
  • RQ4REAN은 엔드 투 엔드 LSTM 기반 모델과 비교해, 정적 이미지 및 영상 매칭 작업에서 과적합성과 성능 측면에서 어떻게 다른가?

주요 결과

  • IJB-S 감시 영상에서 감시 영상로의 프로토콜에서, REAN은 기준 LSTM 대비 순위 5에서 15.24% 향상되어 노이즈가 많은 영상 프레임에 대한 강건성을 입증했다.
  • 다중 시점 감시 영상에서 예약 영상로의 프로토콜에서, REAN은 1% FPIR에서 오픈 세트 인식 성능을 5.45% 향상시켜 교차 도메인 매칭에서의 효과성을 보였다.
  • YTF 데이터셋에서 REAN은 96.60%의 검증 정확도를 달성해 C-FAN(96.50%) 및 기타 최신 기술을 능가했으며, YTF는 상대적으로 높은 프레임 품질을 가짐에도 불구하고 성능이 뛰어났다.
  • PaSC에서 수동 장치 시나리오에서 REAN은 FAR=0.01일 때 96.52%의 검증 비율을 기록해 기준 방법을 능가했으며, 최신 기술 수준에 가까워졌다.
  • REAN은 단순한 LSTM 기준 모델(96.60% 정확도)이 YTF에서 과적합으로 인해 정확도가 60.00%로 떨어지는 것과 대비해 뚜렷이 뛰어난 성능을 보였다.
  • REAN이 생성한 주의 점수는 맥락 정보를 활용해 분류 가능한 프레임을 효과적으로 식별하여 노이즈 억제와 동시에 핵심 얼굴 특징을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.