Skip to main content
QUICK REVIEW

[논문 리뷰] RefineFace: Refinement Neural Network for High Performance Face Detection

Shifeng Zhang, Cheng Chi|arXiv (Cornell University)|2019. 09. 10.
Face recognition and analysis참고 문헌 80인용 수 20
한 줄 요약

RefineFace는 단일 스텝 정렬 신경망을 제안하여 회귀 정확도와 분류 재현율을 향상시켜 얼굴 검출 성능을 향상시킨다. 선택적 이단계 회귀, 선택적 이단계 분류, 스케일 인식 마진 손실, 특징 감독 모듈, 수용장역 강화를 포함한 다섯 가지 모듈을 통합하여 WIDER FACE Hard 서브셋에서 SOTA AP 90.0%를 달성하고, ResNet-18를 사용할 경우 37.3 FPS의 실시간 성능을 확보한다.

ABSTRACT

Face detection has achieved significant progress in recent years. However, high performance face detection still remains a very challenging problem, especially when there exists many tiny faces. In this paper, we present a single-shot refinement face detector namely RefineFace to achieve high performance. Specifically, it consists of five modules: Selective Two-step Regression (STR), Selective Two-step Classification (STC), Scale-aware Margin Loss (SML), Feature Supervision Module (FSM) and Receptive Field Enhancement (RFE). To enhance the regression ability for high location accuracy, STR coarsely adjusts locations and sizes of anchors from high level detection layers to provide better initialization for subsequent regressor. To improve the classification ability for high recall efficiency, STC first filters out most simple negatives from low level detection layers to reduce search space for subsequent classifier, then SML is applied to better distinguish faces from background at various scales and FSM is introduced to let the backbone learn more discriminative features for classification. Besides, RFE is presented to provide more diverse receptive field to better capture faces in some extreme poses. Extensive experiments conducted on WIDER FACE, AFW, PASCAL Face, FDDB, MAFA demonstrate that our method achieves state-of-the-art results and runs at $37.3$ FPS with ResNet-18 for VGA-resolution images.

연구 동기 및 목표

  • 작은 얼굴과 극단적인 자세에 대해 지속적인 고성능 얼굴 검출 문제를 해결한다.
  • 정렬 오차(LOC 오차)로 인한 잘못된 양성 결과를 줄이기 위해 위치 정확도를 향상시킨다.
  • 복잡한 상황에서 특히 잘못된 음성 결과와 누락 검출을 줄이기 위해 재현율 효율을 향상시킨다.
  • 실시간 추론 속도를 유지하면서도 SOTA 정확도를 달성하는 단일 스텝 검출기 개발.
  • 다양한 척도와 자세에서 강력한 검출을 가능하게 하기 위해 특징 학습과 수용장역 다양성을 향상시키는 정렬 네트워크 설계.

제안 방법

  • 고수준 특징 맵에서 앵커 위치와 크기를 조정하여 최종 회귀기의 초기화를 향상시키기 위해 선택적 이단계 회귀(STR)를 도입한다.
  • 저수준 특징에서 쉬운 음성 샘플을 걸러내어 검색 공간을 줄이고 분류 효율을 향상시키기 위해 선택적 이단계 분류(STC)를 활용한다.
  • 다양한 척도에서 얼굴과 배경 간의 구분 능력을 향상시켜 일반화 성능을 향상시키기 위해 스케일 인식 마진 손실(SML)을 적용한다.
  • 백본 네트워크가 더 구분력 있는 특징을 학습하도록 유도하기 위해 특징 감독 모듈(FSM)을 통합한다.
  • 극단적인 자세에서의 얼굴 검출 능력을 향상시키기 위해 수용장역 다양성을 증가시키기 위해 수용장역 강화(RFE)를 제안한다.
  • 모든 모듈을 통합하여 단일 스텝 얼굴 검출기로 구성하며, 추론 오버헤드를 최소화하면서 동시에 회귀와 분류를 공동 최적화한다.

실험 결과

연구 질문

  • RQ1정렬 기반 단일 스텝 검출기로 WIDER FACE 및 FDDB와 같은 도전적인 얼굴 검출 벤치마크에서 SOTA 성능을 달성할 수 있는가?
  • RQ2두 단계 정렬 전략은 추론 지연을 증가시키지 않고도 회귀 정확도 향상에 얼마나 효과적인가?
  • RQ3선택적 분류와 스케일 인식 손실은 재현율 효율 향상과 잘못된 양성 결과 감소에 얼마나 기여하는가?
  • RQ4강화된 수용장역은 극단적인 자세 및 가림 상황에서 검출의 강건성을 향상시키는가?
  • RQ5다양한 정밀도 모듈의 통합은 다양한 데이터셋과 얼굴 척도에서 일관된 성능 향상 기여를 하는가?

주요 결과

  • RefineFace는 WIDER FACE Hard 서브셋에서 SOTA 평균 정밀도(AP) 90.0%를 달성하여 이전 최고 성능인 STN보다 1.55% 높게 기록했다.
  • FDDB 데이터셋에서 1,000개의 잘못된 양성 결과에서 진짜 양성률이 99.11%에 달해 제약 조건이 없는 조건에서 새로운 SOTA 성능을 확립했다.
  • MAFA 데이터셋에서 전체 서브셋 기준 83.9% AP, 가림 서브셋 기준 96.2% AP, 무시되지 않은 서브셋 기준 95.7% AP를 기록하여 가림에 대한 강력한 내성성을 입증했다.
  • VGA 해상도 이미지에서 ResNet-18를 사용할 경우 37.3 FPS로 실행되어 표준 GPU 하드웨어에서 실시간 추론 능력을 보였다.
  • 제거 실험 결과 각 구성 요소인 STR, STC, SML, FSM, RFE가 LOC 오차와 CLS 오차 감소에 기여하며 성능 향상에 기여하는 것으로 확인되었다.
  • PASCAL Face 벤치마크에서 9개의 SOTA 방법과 3개의 상업용 검출기보다 뛰어나 99.45% AP를 기록하여 이 벤치마크에서 보고된 최고 성능이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.