Skip to main content
QUICK REVIEW

[논문 리뷰] Facial Landmarks Detection by Self-Iterative Regression based Landmarks-Attention Network

Tao Hu, Honggang Qi|arXiv (Cornell University)|2018. 03. 18.
Face recognition and analysis참고 문헌 38인용 수 7
한 줄 요약

이 논문은 단일 딥 리그레서를 반복적으로 예측을 정밀하게 다듬는 방식으로, 다중 단계로 연결된 리그레서 대신 사용하는 Self-Iterative Regression (SIR) 프레임워크와 Landmarks-Attention Network (LAN)을 제안한다. 이 방법은 상태 기준 성능을 달성하면서도 단지 372만 개의 파라미터를 사용하여 모델 복잡성과 메모리 사용량을 크게 줄이며 높은 정확도를 유지한다.

ABSTRACT

Cascaded Regression (CR) based methods have been proposed to solve facial landmarks detection problem, which learn a series of descent directions by multiple cascaded regressors separately trained in coarse and fine stages. They outperform the traditional gradient descent based methods in both accuracy and running speed. However, cascaded regression is not robust enough because each regressor's training data comes from the output of previous regressor. Moreover, training multiple regressors requires lots of computing resources, especially for deep learning based methods. In this paper, we develop a Self-Iterative Regression (SIR) framework to improve the model efficiency. Only one self-iterative regressor is trained to learn the descent directions for samples from coarse stages to fine stages, and parameters are iteratively updated by the same regressor. Specifically, we proposed Landmarks-Attention Network (LAN) as our regressor, which concurrently learns features around each landmark and obtains the holistic location increment. By doing so, not only the rest of regressors are removed to simplify the training process, but the number of model parameters is significantly decreased. The experiments demonstrate that with only 3.72M model parameters, our proposed method achieves the state-of-the-art performance.

연구 동기 및 목표

  • 다중 단계로 연결된 리그레서의 한계, 즉 높은 계산 비용과 오차 전파로 인한 낮은 강인성 문제를 해결하기 위해.
  • 다중 리그레서를 단일 자기 반복 리그레서로 대체하여 딥 러닝 기반 얼굴 랜드마크 검출의 모델 복잡성과 파라미터 수를 줄이기 위해.
  • 전용 주의 메커니즘을 통해 각 랜드마크의 국소적 외형 특징에 집중함으로써 특징 표현을 향상시키기 위해.
  • 여러 반복 단계에서 동일한 리그레서를 재사용함으로써 학습 및 추론 과정을 단순화하기 위해.

제안 방법

  • SIR 프레임워크는 단일 딥 리그레서를 훈련하여 굵은 단계에서 정교한 단계로의 내림차순 방향을 학습하고, 동일한 모델을 사용해 반복적으로 파라미터를 업데이트한다.
  • Landmarks-Attention Network (LAN)은 각 랜드마크 주변의 국소적 특징을 개별적으로 추출하여 개별 랜드마크에 대한 분별력을 향상시킨다.
  • 각 랜드마크의 특징은 병렬로 처리된 후 융합되어 전체적인 위치 보정을 예측한다.
  • 훈련 중에는 파arameter 공간에서 무작위로 가우시안 샘플링을 사용하여 다양한 초기화를 시뮬레이션하고 강인성을 향상시킨다.
  • 추론 중에는 동일한 리그레서를 반복적으로 호출하여 각 호출이 랜드마크 좌표를 정밀하게 다듬는다.
  • 예측된 랜드마크 오프셋에 대한 회귀 손실을 사용하여 모델을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1단일 자기 반복 리그레서가 다중 단계로 연결된 리그레서와 비교해 유사하거나 더 높은 성능을 달성할 수 있는가?
  • RQ2주의 메커니즘을 통해 국소적 랜드마크 특징에 집중함으로써 정확도 향상과 모델 복잡성 감소에 어떤 영향을 미치는가?
  • RQ3정확도와 메모리 효율성 측면에서 자기 반복 정밀화 과정의 최적 반복 수는 얼마인가?
  • RQ4파arameter 공간에서의 샘플링 전략 선택이 SIR 프레임워크의 강인성과 수렴성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 SIR 방법은 300-W 벤치마크에서 정규화된 평균 오차(NME) 5.04%를 달성하여 기준 기반 다중 단계 리그레서 방법(6.23%)과 더 큰 모델을 사용하는 최신 기술 수준의 방법들을 능가한다.
  • 단지 372만 개의 파라미터를 사용함으로써 SIR 모델는 15.6MB의 메모리만 사용하며, MDM(322.3MB)과 RAR(62.6MB 이상)와 같은 다른 딥 러닝 기반 방법들보다 크게 줄어든다.
  • Landmarks-Attention Network (LAN)은 스택드 패치 특징 추출 방법(SIR-Stack)보다 명확한 성능 우위를 보이며, 개별 랜드마크 특징 학습의 이점을 입증한다.
  • 반복 수를 늘릴수록 정확도는 4회 반복까지 향상되며, 이후에는 성능이 안정화된다. SIR는 기준 CR과 달리 반복 수 증가에 따라 메모리 사용량이 일정하게 유지된다.
  • 가우시안 샘플링의 하이퍼파라미터 선택에 대해 강인하며, 샘플링 분포의 최적 값은 σ = 0.2에서 도달된다.
  • 정성적 결과는 HELEN, LFPW, IBUG 및 300-W 경쟁 세트를 포함한 다양한 데이터셋에서 정확한 랜드마크 정렬을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.