Skip to main content
QUICK REVIEW

[논문 리뷰] Recurrent Regression for Face Recognition

Li Yang, Wenming Zheng|arXiv (Cornell University)|2016. 07. 24.
Face recognition and analysis참고 문헌 22인용 수 5
한 줄 요약

이 논문은 순차적인 이미지 변환을 모델링함으로써 통합된 크로스포즈 및 영상 기반 얼굴 인식을 위한 순환 회귀 신경망(RRNN)을 제안한다. 순환 인코더-디코더 구조를 활용하고 포즈 시퀀스에 대한 감독을 통해 RRNN은 다양한 포즈 간에 특징을 적응적으로 기억하고 잊는다. YTC에서 86.6%의 정확도와 MultiPIE에서 95.2%의 정확도를 기록하며 최신 기술 수준의 성능을 달성한다.

ABSTRACT

To address the sequential changes of images including poses, in this paper we propose a recurrent regression neural network(RRNN) framework to unify two classic tasks of cross-pose face recognition on still images and video-based face recognition. To imitate the changes of images, we explicitly construct the potential dependencies of sequential images so as to regularize the final learning model. By performing progressive transforms for sequentially adjacent images, RRNN can adaptively memorize and forget the information that benefits for the final classification. For face recognition of still images, given any one image with any one pose, we recurrently predict the images with its sequential poses to expect to capture some useful information of others poses. For video-based face recognition, the recurrent regression takes one entire sequence rather than one image as its input. We verify RRNN in static face dataset MultiPIE and face video dataset YouTube Celebrities(YTC). The comprehensive experimental results demonstrate the effectiveness of the proposed RRNN method.

연구 동기 및 목표

  • 정적 이미지와 영상 시퀀스에서의 포즈 변동 문제를 다루기.
  • 크로스포즈 인식과 영상 기반 인식이라는 두 가지 전통적인 얼굴 인식 작업을 하나의 프레임워크로 통합하기.
  • 이미지 시퀀스의 순차적 의존성을 모델링하여 학습 과정을 정규화하고 포즈 및 외관 변동에 대한 강건성을 향상시키기.
  • 이미지 시퀀스의 순환 변환을 통해 시간 동적 특성을 명시적으로 인코딩하여 인식 정확도 향상시키기.
  • 복잡한 포즈 및 외관 변동이 존재하는 비제약적 데이터셋에서의 효과성 입증하기.

제안 방법

  • 순환 인코더-디코더 아키텍처를 사용하여 순차적인 이미지 변환을 모델링하는 순환 회귀 신경망(RRNN)을 제안한다.
  • 기존의 포즈 시퀀스에 기반하여 예측된 이미지 시퀀스의 일관성을 강제하기 위해 시퀀스 재구성 손실을 사용한다.
  • 재구성된 이미지 시퀀스 전반에 걸쳐 구조적 일관성을 유지하기 위해 전역 정규화 항목을 통합한다.
  • 영상 기반 인식을 위한 분류 성능 향상을 위해 분류용 레이블 예측 손실을 통합한다.
  • 재구성, 전역 일관성, 분류 손실을 모두 포함하는 공동 목표 함수를 사용해 모델을 엔드 투 엔드로 훈련한다.
  • 알려진 포즈 순서를 기반으로 단일 입력 이미지에서 순차적 포즈를 예측함으로써 동일한 프레임워크를 정적 이미지에 적용한다.

실험 결과

연구 질문

  • RQ1통합된 딥 러닝 프레임워크가 정적 이미지 기반 크로스포즈 얼굴 인식과 영상 기반 얼굴 인식을 효과적으로 처리할 수 있는가?
  • RQ2순차적인 이미지 변환을 모델링함으로써 포즈 및 외관 변동에 대한 강건성이 어떻게 향상되는가?
  • RQ3순환 메모리 메커니즘이 인식 성능 향상을 위해 포즈 간의 상호의존성을 어떻게 포착하는가?
  • RQ4목표 함수의 다양한 구성 요소(재구성, 전역 정규화, 분류)가 최종 성능에 미치는 영향은 무엇인가?
  • RQ5제안된 방법이 복잡한 포즈 변동이 존재하는 벤치마크 데이터셋에서 기존 최신 기술 수준의 방법들을 능가하는가?

주요 결과

  • RRNN은 YouTube Celebrities(YTC) 데이터셋에서 평균 86.6%의 정확도를 기록하며, 이는 이전 최신 기술 수준의 방법보다 최대 7.2%포인트 높은 성능이다.
  • MultiPIE 데이터셋에서 RRNN은 크로스포즈 얼굴 인식에서 95.2%의 정확도를 달성하여 포즈 변동에 대한 강력한 일반화 능력을 보였다.
  • 제거 실험 결과, 시퀀스 재구성 손실과 레이블 예측 손실을 모두 포함할 경우 성능 향상이 두드러지며, 이 두 가지가 동시에 활성화되었을 때 가장 우수한 성능를 기록했다.
  • 놀랍게도, 정면 얼굴($0^\circ$)을 갤러리 세트로 사용할 경우 비정면 포즈보다 정확도가 낮았는데, 이는 오차 전파와 비정면 시점에서 더 풍부한 윤곽 정보가 존재하기 때문으로 분석된다.
  • 모델의 순환 구조는 효과적인 특징 기억 및 무시 기능을 가능하게 하여 다양한 포즈 간의 외관 변동에 대한 강건성을 향상시켰다.
  • 이 방법은 두 데이터셋 모두에서 MMDML, SSDML, DFRV와 같은 부분공간 기반 및 거리 기반 접근 방식을 일관되게 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.