Skip to main content
QUICK REVIEW

[논문 리뷰] PFLD: A Practical Facial Landmark Detector

Xiaojie Guo, Siyuan Li|ArXiv.org|2019. 02. 28.
Face recognition and analysis참고 문헌 46인용 수 35
한 줄 요약

PFLD는 기하학적 규제 손실과 보조 자세 분기를 갖춘 경량의 엔드-투-엔드 단일 스테이지 얼굴 랜드마크 검출기를 제시하며, 모바일에서 초고속 속도(140 fps 이상)와 아주 작은 2.1 MB 모델로 높은 정확도를 달성합니다.

ABSTRACT

Being accurate, efficient, and compact is essential to a facial landmark detector for practical use. To simultaneously consider the three concerns, this paper investigates a neat model with promising detection accuracy under wild environments e.g., unconstrained pose, expression, lighting, and occlusion conditions) and super real-time speed on a mobile device. More concretely, we customize an end-to-end single stage network associated with acceleration techniques. During the training phase, for each sample, rotation information is estimated for geometrically regularizing landmark localization, which is then NOT involved in the testing phase. A novel loss is designed to, besides considering the geometrical regularization, mitigate the issue of data imbalance by adjusting weights of samples to different states, such as large pose, extreme lighting, and occlusion, in the training set. Extensive experiments are conducted to demonstrate the efficacy of our design and reveal its superior performance over state-of-the-art alternatives on widely-adopted challenging benchmarks, i.e., 300W (including iBUG, LFPW, AFW, HELEN, and XM2VTS) and AFLW. Our model can be merely 2.1Mb of size and reach over 140 fps per face on a mobile phone (Qualcomm ARM 845 processor) with high precision, making it attractive for large-scale or real-time applications. We have made our practical system based on PFLD 0.25X model publicly available at \url{http://sites.google.com/view/xjguo/fld} for encouraging comparisons and improvements from the community.

연구 동기 및 목표

  • 포즈, 조명, 가림 등 제약되지 않는 환경에서 정확하고, 효율적이며 컴팩트한 얼굴 랜드마크 검출의 실용적 요구를 충족합니다.
  • 모바일/임베디드 기기에 적합한 속도를 가진 단일 스테이지 네트워크를 개발합니다.
  • 포즈와 조건 전반에 걸친 강건성을 향상시키기 위해 학습에 기하학적 규제와 데이터 불균형 처리를 도입합니다.
  • 최첨단 정확도를 희생하지 않으면서 매우 컴팩트한 모델을 가능하게 하여 모빌 하드웨어에서 실시간 배치를 가능하게 합니다.

제안 방법

  • 크기를 줄이고 속도를 높이기 위해 MobileNet 블록을 사용한 엔드투엔드 단일 스테이지 백본 네트워크를 설계합니다.
  • 추가 주석을 필요로 하지 않고 3D 머리 포즈(yaw, pitch, roll)를 추정하는 보조 네트워크를 도입합니다.
  • 3D 포즈 기반 기하학적 규제와 샘플별 가중치를 결합하는 새로운 손실을 제안하여 데이터 불균형을 해결합니다.
  • 정확한 랜드마크 위치 지정을 위한 수용 영역을 확장하기 위해 다중 스케일 완전 연결(MS-FC) 계층을 도입합니다.
  • 포즈 인식 기반 증강 및 규제와 함께 학습하고, 테스트는 효율성을 위해 백본 네트워크만 사용합니다.

실험 결과

연구 질문

  • RQ1제약되지 않은 조건(포즈, 표정, 조명, 가림)에서 컴팩트한 모델로 높은 랜드마크 위치 추정 정확도를 달성하는 방법은?
  • RQ2기하학적 규제와 포즈 인식 학습 objective가 최첨단 방법들에 비해 강건성을 향상시킬 수 있는가?
  • RQ3정확도를 희생하지 않으면서 소형 발자국으로 모바일 기기에서 실시간 성능을 유지하는 것이 가능한가?

주요 결과

  • PFLD 변형은 300W 및 AFLW 벤치마크에서 여러 최첨단 방법을 능가합니다.
  • 0.25X 모델은 크기가 크게 감소(2.1 MB)하고 높은 속도로 강한 정확도를 달성합니다.
  • 1X 모델은 더 높은 정확도를 제공하면서도 모바일 하드웨어에서 실시간 성능을 가능하게 합니다.
  • 0.25X 및 1X 모델은 Qualcomm ARM 845 프로세서에서 얼굴당 140 fps 이상으로 실행됩니다.
  • 보조 포즈 분기와 제안된 손실은 포즈, 가림 및 조명 변화에 대한 강인성 향상에 공동으로 기여합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.