Skip to main content
QUICK REVIEW

[논문 리뷰] Face Alignment Robust to Pose, Expressions and Occlusions

Vishnu Naresh Boddeti, Myung-Cheol Roh|arXiv (Cornell University)|2017. 07. 19.
Face recognition and analysis참고 문헌 29인용 수 4
한 줄 요약

이 논문은 극한의 변형 조건에서도 얼굴 모양, 자세, 표정 및 이진 망막 레이블을 함께 추정할 수 있는 강건한 제약 로컬 모델의 앙상블(ERCLM)을 제안한다. 이는 이산화된 자세/표정/망막 공간에서 가설 수립-검증 전략을 사용하고, 망막 인식 기반의 형태 피팅을 통해 강건한 형태 추정을 실현한다. 결과적으로 ERCLM는 망막, 자세, 표정 변화가 있는 실생활 얼굴 이미지에서 최신 기술 수준의 정확도와 안정성을 확보한다.

ABSTRACT

We propose an Ensemble of Robust Constrained Local Models for alignment of faces in the presence of significant occlusions and of any unknown pose and expression. To account for partial occlusions we introduce, Robust Constrained Local Models, that comprises of a deformable shape and local landmark appearance model and reasons over binary occlusion labels. Our occlusion reasoning proceeds by a hypothesize-and-test search over occlusion labels. Hypotheses are generated by Constrained Local Model based shape fitting over randomly sampled subsets of landmark detector responses and are evaluated by the quality of face alignment. To span the entire range of facial pose and expression variations we adopt an ensemble of independent Robust Constrained Local Models to search over a discretized representation of pose and expression. We perform extensive evaluation on a large number of face images, both occluded and unoccluded. We find that our face alignment system trained entirely on facial images captured "in-the-lab" exhibits a high degree of generalization to facial images captured "in-the-wild". Our results are accurate and stable over a wide spectrum of occlusions, pose and expression variations resulting in excellent performance on many real-world face datasets.

연구 동기 및 목표

  • 자세, 표정, 망막, 형태 추정이 상호 의존하는 '닭과 계란 문제'를 해결한다.
  • 제약 없는 '실생활' 환경에서 부분 망막, 알려지지 않은 얼굴 자세, 다양한 표정에 강건한 방법을 개발한다.
  • 각 랜드마크에 대해 이진 망막 레이블을 명시적으로 추정하여, 추후 응용 분야(예: 인식, 3D 모델링)에 유용한 보조 정보를 제공한다.
  • '실내 실험실' 데이터만으로 훈련함에도 불구하고 '실생활' 데이터셋에서 뛰어난 성능을 내기 위해 일반화 능력을 향상시킨다.
  • 모호한 정렬 상황에서 다중 가설 출력을 통해 체계 수준의 결정에 강건성을 확보한다.

제안 방법

  • 얼굴 자세, 표정, 이진 망막 레이블의 이산화된 공간을 커버하기 위해 독립적인 강건한 제약 로컬 모델(RCLMs)의 앙상블을 사용한다.
  • 가설 수립-검증 전략을 적용: 무작위로 샘플된 랜드마크 검출기 응답 부분집합에 형태를 피팅하여 가설을 생성하고, 정렬 품질을 평가하여 각 가설을 평가한다.
  • 랜드마크별로 이진 망막 레이블을 도입하여 망막 추론을 실시하며, 형태 피팅 과정에서 어떤 구성이 가시적인 얼굴 구조를 가장 잘 설명하는지 테스트함으로써 이를 추론한다.
  • 강건성과 효율성의 균형을 위해 무작위, 탐욕적, 신뢰도 기반의 세 가지 샘플링 전략을 사용하여 랜드마크 가설을 생성한다.
  • 정확도 향상을 위해 최고의 가설을 최종 형태 정밀 조정 단계에서 개선한다.
  • CLM 기반 최적화의 본질적 강건성을 활용하여, 회귀 기반 방법과 달리 열악한 초기 경계 상자에도 강인함을 확보한다.

실험 결과

연구 질문

  • RQ1극한의 변형 조건에서 자세, 표정, 망막 레이블 및 형태 추정을 동시에 강건하게 수행할 수 있는 얼굴 정렬 시스템은 가능한가?
  • RQ2망막 추론은 형태 기반 정렬 프레임워크에 어떻게 통합되어 부분 망막된 얼굴에 대한 성능을 향상시킬 수 있는가?
  • RQ3실내 실험실 데이터로만 훈련된 모델이 알려지지 않은 자세, 표정, 망막을 가진 실생활 이미지로 일반화되는가?
  • RQ4이산화된 자세/표정/망막 공간에서의 가설 수립-검증 접근 방식은 이러한 요소를 별도로 다루는 기존 파ipelines를 능가하는가?
  • RQ5다중 정렬 가설은 모호하거나 망막된 상황에서 체계 수준의 강건성을 얼마나 향상시킬 수 있는가?

주요 결과

  • ERCLM는 망막과 자세 변화가 심한 데이터셋에서 최신 기술 수준의 얼굴 정렬 성능을 달성하여 뛰어난 정확도와 안정성을 입증한다.
  • 실내 실험실 데이터만으로 훈련되었음에도 불구하고 실생활 이미지로의 일반화 능력이 뛰어나, 강력한 도메인 일반화 능력을 보여준다.
  • ERCLM에서 상위 3개의 랭크된 가설은 실패 사례의 100%에서 정확한 정렬을 포함하며, 자주 두 번째 또는 세 번째로 랭크된다.
  • 표 IV에서 보듯이, 랜드마크 검출기 오류에 더 강건한 것은 무작위 샘플링 방식이며, 탐욕적 또는 신뢰도 기반 샘플링보다 우수하다.
  • ERCLM는 회귀 기반 방법보다 계산적으로 느리며(1장당 약 10초), 그러나 초기화에 대한 강건성과 병렬 처리 가능성으로 인해 이 단점을 상쇄한다.
  • 시스템은 각 랜드마크에 대해 이진 망막 레이블을 출력하여, 3D 헤드 포즈 추정 및 표정 인식과 같은 후속 작업에 유용한 보조 정보를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.