Skip to main content
QUICK REVIEW

[논문 리뷰] Human and Sheep Facial Landmarks Localisation by Triplet Interpolated Features

Heng Yang, Renqiao Zhang|arXiv (Cornell University)|2015. 09. 16.
Face recognition and analysis참고 문헌 38인용 수 4
한 줄 요약

이 논문은 대량의 헤드 포즈 변화와 희소한 랜드마크 애너테이션 조건에서 인간과 양의 얼굴 랜드마크 국소화에 대해 강건한 성능을 보이는 트리플릿 보간 특징(TIF) 방법을 제안한다. 세 개의 앵커 랜드마크를 활용한 특징 추출을 강화하고, 음의 상관관계를 가진 데이터 증강 기법을 도입함으로써, 300W(인간) 및 600장의 이미지로 구성된 새로운 양 얼굴 데이터셋에서 최신 기술 수준의 성능을 달성하여 도전적인 포즈에서의 성공률을 크게 향상시켰다.

ABSTRACT

In this paper we present a method for localisation of facial landmarks on human and sheep. We introduce a new feature extraction scheme called triplet-interpolated feature used at each iteration of the cascaded shape regression framework. It is able to extract features from similar semantic location given an estimated shape, even when head pose variations are large and the facial landmarks are very sparsely distributed. Furthermore, we study the impact of training data imbalance on model performance and propose a training sample augmentation scheme that produces more initialisations for training samples from the minority. More specifically, the augmentation number for a training sample is made to be negatively correlated to the value of the fitted probability density function at the sample's position. We evaluate the proposed scheme on both human and sheep facial landmarks localisation. On the benchmark 300w human face dataset, we demonstrate the benefits of our proposed methods and show very competitive performance when comparing to other methods. On a newly created sheep face dataset, we get very good performance despite the fact that we only have a limited number of training samples and a set of sparse landmarks are annotated.

연구 동기 및 목표

  • 희소 랜드마크와 큰 헤드 포즈 변화가 존재하는 실제 환경에서 얼굴 랜드마크 국소화의 과제를 해결한다.
  • 인간과 양 얼굴에 대한 계단식 형태 회귀의 강건성을 향상시킨다.
  • 제한된 데이터 환경에서 불균형한 훈련 데이터 분포로 인한 성능 저하 문제를 해결한다.
  • 동물 복지 응용을 위해 새로운 소규모 양 얼굴 데이터셋에서 정확한 랜드마크 검출을 가능하게 한다.
  • 랜드마크가 희소하게 분포되어 있을 경우에도 효과적인 특징 추출 방법을 개발한다.

제안 방법

  • 세 개의 랜드마크 앵커를 사용해 형태 색인 기반 특징을 계산하는 트리플릿 보간 특징(TIF) 기법을 제안하여 포즈 변화와 형태 왜곡에 대한 강건성을 향상시킨다.
  • TIF를 계단식 형태 회귀 프레임워크에 통합하여 반복적으로 랜드마크 예측을 정밀하게 개선한다.
  • 소수의 훈련 샘플이 훈련 분포 내 밀도에 따라 더 많은 무작위 초기화를 받는 음의 상관관계 증강(NCA) 전략을 설계한다.
  • 확률 밀도 함수를 사용해 증강 빈도를 결정하며, 밀도가 낮은 샘플일수록 더 많은 증강을 적용한다.
  • 실제 환경 제약을 반영하기 위해 밀도 높은(68점) 및 희소한(14점) 랜드마크 설정 모두에서 모델을 훈련하고 평가한다.
  • 경계 상자 생성을 위해 dlib 얼굴 검출기와 수동 검증을 활용하여 현실적인 평가 조건을 확보한다.

실험 결과

연구 질문

  • RQ1트리플릿 보간 특징는 큰 헤드 포즈 변화와 희소한 랜드마크 애너테이션 조건에서 랜드마크 국소화 정확도를 향상시킬 수 있는가?
  • RQ2작은 훈련 데이터셋에서의 데이터 불균형은 랜드마크 국소화 성능에 어떤 영향을 미치며, 이를 효과적으로 완화할 수 있는가?
  • RQ3제안된 음의 상관관계 증강 기법은 드문 또는 국소화가 어려운 얼굴 포즈에 대한 일반화 능력을 향상시키는가?
  • RQ4TIF 방법은 최소한의 랜드마크 애너테이션으로 인간과 양 얼굴 데이터셋에서 경쟁적인 성능을 달성할 수 있는가?
  • RQ5TIF 방법은 도전적인 실제 환경 조건에서 기존 최신 기술 수준의 방법보다 얼마나 뛰어난 성능을 보이는가?

주요 결과

  • 300W 벤치마크에서 제안된 TIF + NCA 방법은 비교된 모든 방법 중 최고의 성능을 기록했으며, 특히 희소 랜드마크 설정에서 뛰어난 성능을 보였다.
  • TIF 방법은 희소 랜드마크 국소화 조건에서 기준 RCPR 및 ESR 모델의 성능을 크게 향상시켜 낮은 랜드마크 수 환경에서의 효과성을 입증했다.
  • NCA 증강 기법은 고포즈 변화 케이스에서 총 689장의 테스트 이미지 중 30개 이상의 성공 국소화 수를 증가시켜 강력한 강건성 향상을 보였다.
  • 단지 600장의 이미지로 구성된 새로운 양 얼굴 데이터셋에서도 제한된 데이터와 희소한 랜드마크 애너테이션 조건에도 불구하고 뛰어난 성능을 달성했다.
  • 특히 도전적인 포즈에서 평균 국소화 오차와 성공률 측면에서 기존 최신 기술 수준의 접근법을 능가하는 성능을 보였다.
  • TIF와 NCA의 조합은 극단적인 헤드 포즈에서의 실패율을 감소시켜 표준 데이터 증강 기법과 기준 특징 기반 방법에 비해 뚜렷한 이점을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.