Skip to main content
QUICK REVIEW

[논문 리뷰] CenterFace: Joint Face Detection and Alignment Using Face as Point

Yuanyuan Xu, Yan Wan|arXiv (Cornell University)|2019. 11. 09.
Advanced Image and Video Retrieval Techniques참고 문헌 38인용 수 14
한 줄 요약

CenterFace는 얼굴의 단일점 표현을 사용하여 단일 스테이지, 앵커 기반 방식이 아닌 방법으로 얼굴 검출과 특징점 정렬을 동시에 수행한다. 세분화 히트맵을 통해 얼굴 존재 여부, 바운딩 박스, 오프셋 및 5개의 얼굴 특징점을 예측하며, NVIDIA 2080Ti에서 실시간 추론(200 FPS)을 구현하고 WIDER FACE(0.935/0.932, Easy/Test 기준)와 FDDB(0.980 불연속적)에서 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

Face detection and alignment in unconstrained environment is always deployed on edge devices which have limited memory storage and low computing power. This paper proposes a one-stage method named CenterFace to simultaneously predict facial box and landmark location with real-time speed and high accuracy. The proposed method also belongs to the anchor free category. This is achieved by: (a) learning face existing possibility by the semantic maps, (b) learning bounding box, offsets and five landmarks for each position that potentially contains a face. Specifically, the method can run in real-time on a single CPU core and 200 FPS using NVIDIA 2080TI for VGA-resolution images, and can simultaneously achieve superior accuracy (WIDER FACE Val/Test-Easy: 0.935/0.932, Medium: 0.924/0.921, Hard: 0.875/0.873 and FDDB discontinuous: 0.980, continuous: 0.732). A demo of CenterFace can be available at https://github.com/Star-Clouds/CenterFace.

연구 동기 및 목표

  • 자원 제약이 있는 엣지 디바이스에서 제약 없는 환경에서 정확한 얼굴 검출 및 정렬을 구현하는 데 도전한다.
  • 효율성과 정확도 향상을 위해 앵커 기반 방법의 한계를 극복하기 위해 앵커 기반 외부 대안을 제안한다.
  • 단일 순방향 전파에서 얼굴 바운딩 박스와 5개의 얼굴 특징점 위치를 동시에 예측한다.
  • WIDER FACE 및 FDDB와 같은 벤치마크 데이터셋에서 높은 정확도를 유지하면서도 실시간 추론 속도를 달성한다.
  • 최소한의 메모리 및 계산 오버헤드로 CPU 전용 또는 저전력 디바이스에 배포 가능하게 한다.

제안 방법

  • 각 얼굴을 특징 맵 내의 단일 키포인트(중심점)로 표현하여 앵커 기반 방법에 비해 복잡도를 감소시킨다.
  • 각 공간 위치에서 얼굴 존재 가능성 확률을 예측하기 위해 의미 히트맵을 사용한다.
  • 중심점에서부터 바운딩 박스 오프셋과 5개의 얼굴 특징점 좌표를 회귀 헤드를 통해 직접 예측한다.
  • 단일 스테이지 검출기 아키텍처를 사용하여 한 번의 순방향 전파에서 얼굴 위치와 특징점을 동시에 회귀한다.
  • 다양한 스케일의 얼굴을 처리하고 검출의 강건성을 향상시키기 위해 특징 피라미드 네트워크를 활용한다.
  • 분류, 박스 회귀, 특징점 회귀 손실을 조합한 복합 손실 함수를 사용해 모델을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1단일 스테이지, 앵커 기반 방식이 아닌 방법이 실시간 추론 속도를 유지하면서도 높은 정확도를 달성할 수 있는가?
  • RQ2얼굴의 단일점 표현(중심점)이 검출 및 정렬 작업을 단순화하는 데 얼마나 효과적인가?
  • RQ3제안된 방법이 표준 벤치마크에서 기존의 앵커 기반 및 앵커 기반 외부 얼굴 검출기보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4CPU 전용 또는 저전력 엣지 디바이스에서 효율적으로 작동하면서도 높은 정확도를 달성할 수 있는가?
  • RQ5바운딩 박스와 얼굴 특징점의 동시 예측이 별도의 검출 및 정렬 파이프라인에 비해 어떻게 비교되는가?

주요 결과

  • CenterFace는 WIDER FACE 검증 세트와 테스트-Easy 세트에서 각각 0.935와 0.932의 평균 정밀도를 기록하여 이전 최신 기술 수준의 방법을 초월한다.
  • 더 어려운 WIDER FACE Medium 및 Hard 세트에서는 각각 0.924와 0.921 mAP를 기록하여 강력한 일반화 능력을 보여준다.
  • FDDB에서는 불연속적인 얼굴에 대해 0.980 mAP, 연속적인 얼굴에 대해 0.732 mAP를 기록하여 어려운, 혼잡한 상황에서도 뛰어난 성능을 보인다.
  • VGA 해상도의 이미지에서 단일 NVIDIA 2080Ti GPU에서 200 FPS로 실행되어 실시간 추론이 가능하다.
  • 단일 CPU 코어에서도 실시간 성능을 달성하여 엣지 배포에 적합하다.
  • 앵커 기반 방식을 배제한 설계는 훈련과 추론을 단순화하면서도 높은 정확도를 유지하여 중심점 표현 방식의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.