Skip to main content
QUICK REVIEW

[논문 리뷰] MaskFace: multi-task face and landmark detector

D. A. Yashunin, Tamir Baydasov|arXiv (Cornell University)|2020. 05. 19.
Face recognition and analysis참고 문헌 60인용 수 13
한 줄 요약

MaskFace는 RoIAlign를 사용하여 정밀한 특징 추출을 수행하는 Mask R-CNN 기반의 키포인트 헤드를 얼굴 검출 프레임워크에 통합한 다중 작업 얼굴 및 키포인트 검출 모델을 제안한다. 얼굴과 키포인트를 최소한의 계산 오버헤드로 동시에 예측함으로써, WIDER FACE, AFLW 및 300W 데이터셋에서 최신 기술 수준의 정확도를 달성하며, 단일 작업 및 다중 작업 모델을 모두 능가한다.

ABSTRACT

Currently in the domain of facial analysis single task approaches for face detection and landmark localization dominate. In this paper we draw attention to multi-task models solving both tasks simultaneously. We present a highly accurate model for face and landmark detection. The method, called MaskFace, extends previous face detection approaches by adding a keypoint prediction head. The new keypoint head adopts ideas of Mask R-CNN by extracting facial features with a RoIAlign layer. The keypoint head adds small computational overhead in the case of few faces in the image while improving the accuracy dramatically. We evaluate MaskFace's performance on a face detection task on the AFW, PASCAL face, FDDB, WIDER FACE datasets and a landmark localization task on the AFLW, 300W datasets. For both tasks MaskFace achieves state-of-the-art results outperforming many of single-task and multi-task models.

연구 동기 및 목표

  • 오차 전파와 특징 공유 부족 문제를 야기하는 순차적 단일 작업 얼굴 검출 및 키포인트 위치 지정 파이프라인의 한계를 해결하기 위해.
  • 공유된 표현을 가진 통합 모델을 공동으로 훈련시켜 얼굴 검출 및 키포인트 위치 지정의 정확도를 향상시키기 위해.
  • 희박한 및 조밀한 키포인트에 대해 특히 효과적인 Mask R-CNN 스타일의 키포인트 헤드가 얼굴 키포인트 예측에 적합한지 탐색하기 위해.
  • 맥락 모듈, 특징 피라미드, 백본 선택과 같은 모델 아키텍처 구성 요소가 검출 및 위치 지정 성능에 미치는 영향을 평가하기 위해.
  • 추가적인 데이터 증강 또는 감독 없이도 잘 설계된 다중 작업 모델이 더 복잡한 단일 작업 또는 다중 작업 베이스라인을 능가할 수 있음을 보여주기 위해.

제안 방법

  • Mask R-CNN 기반의 키포인트 예측 헤드를 도입하여 RetinaFace 및 SSH 스타일의 얼굴 검출기 구조를 확장한다.
  • 예측된 바운딩 박스에서 정렬된 특징을 추출하기 위해 RoIAlign을 사용하여 특징과 키포인트 사이에 픽셀 간 일치를 보장한다.
  • 다양한 해상도의 특징을 통합함으로써 작은 얼굴 검출을 향상시키기 위해 특징 피라미드 네트워크(FPN)를 적용한다.
  • 얕은 레이어에서의 특징 표현을 향상시키고 수용장역을 확장하기 위해 맥락 모듈을 도입한다.
  • 앵커 기반 얼굴 검출에서의 클래스 불균형 문제를 해결하기 위해 포칼 손실과 온라인 하드 예외 마이닝(OHEM)을 적용한다.
  • 검출 헤드와 함께 엔드 투 엔드로 훈련되는 L1/L2 손실을 사용하는 회귀 기반의 키포인트 헤드를 사용한다.

실험 결과

연구 질문

  • RQ1Mask R-CNN 스타일의 마스크 헤드가 얼굴 키포인트 검출에 효과적으로 적용되어 정확도를 향상시킬 수 있는가?
  • RQ2공유된 특징을 가진 얼굴 검출 및 키포인트 위치 지정의 공동 훈련이 단일 작업 모델보다 성능을 향상시키는가?
  • RQ3키포인트 헤드의 포함이 얼굴 검출 정확도에 어떤 영향을 미치며, 작업 간 간섭을 어떻게 완화할 수 있는가?
  • RQ4백본 아키텍처, 맥락 모듈, 특징 피라미드의 영향은 검출 및 키포인트 위치 지정 성능에 어떤가?
  • RQ5MaskFace는 최신 기술 수준의 단일 작업 및 다중 작업 모델과 비교해 정확도와 추론 속도에서 어떻게 성과를 내는가?

주요 결과

  • ResNeXt-152를 사용하여 WIDER FACE의 하드 서브셋에서 0.9724의 AP를 달성하며 최신 기술 수준을 확립한다.
  • AFLW에서 5개의 얼굴 키포인트에 대해 CED@0.95가 3.39로, 추가 데이터나 감독 없이도 최고 성능을 기록한다.
  • 모델은 높은 효율성을 유지하여 ResNet-50 기반으로 640x480 이미지에서 약 20 FPS를 달성하고, 얼굴당 약 11ms의 시간으로 키포인트 예측을 수행한다.
  • 제거 실험 결과, 맥락 모듈과 키포인트 헤드가 어려운(작거나 가림을 입은) 얼굴 검출에 있어 크게 향상된 것을 확인했다.
  • 키포인트 헤드는 추가적인 계산 비용이 극히 적어 얼굴당 약 0.11ms에 불과하여 실시간 응용에 적합하다.
  • ResNeXt-152 백본이 가장 높은 성능을 보였으며(AP: 0.9724, CED: 3.39) 강력한 표현력이 정확도 향상에 기여함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.