Skip to main content
QUICK REVIEW

[논문 리뷰] ASFD: Automatic and Scalable Face Detector

Jian Li, Bin Zhang|arXiv (Cornell University)|2022. 01. 26.
Face recognition and analysis참고 문헌 55인용 수 14
한 줄 요약

이 논문은 도메인 특화된 특징 집합 및 강화(자동FAE) 모듈을 탐색하기 위해 미분 가능 신경망 아키텍처 탐색을 사용하는 자동적이고 확장 가능한 얼굴 검출기인 ASFD를 제안한다. 일반 객체 검출과 얼굴 검출 간의 도메인 갭을 해결함으로써, ASFD는 상태 최고 수준의 성능-효율성 트레이드오프를 달성한다. WIDER Face 테스트에서 ASFD-D6는 96.7/96.2/92.1 AP를 기록하고, V100 GPU에서 ASFD-D0는 3.1ms 추론 시간으로 320FPS 이상의 빠른 속도를 달성한다.

ABSTRACT

Along with current multi-scale based detectors, Feature Aggregation and Enhancement (FAE) modules have shown superior performance gains for cutting-edge object detection. However, these hand-crafted FAE modules show inconsistent improvements on face detection, which is mainly due to the significant distribution difference between its training and applying corpus, COCO vs. WIDER Face. To tackle this problem, we essentially analyse the effect of data distribution, and consequently propose to search an effective FAE architecture, termed AutoFAE by a differentiable architecture search, which outperforms all existing FAE modules in face detection with a considerable margin. Upon the found AutoFAE and existing backbones, a supernet is further built and trained, which automatically obtains a family of detectors under the different complexity constraints. Extensive experiments conducted on popular benchmarks, WIDER Face and FDDB, demonstrate the state-of-the-art performance-efficiency trade-off for the proposed automatic and scalable face detector (ASFD) family. In particular, our strong ASFD-D6 outperforms the best competitor with AP 96.7/96.2/92.1 on WIDER Face test, and the lightweight ASFD-D0 costs about 3.1 ms, more than 320 FPS, on the V100 GPU with VGA-resolution images.

연구 동기 및 목표

  • 일반 객체 검출에서 성공한 수작업으로 설계된 특징 집합 및 강화(FAE) 모듈가 얼굴 검출에 적용되었을 때 도메인 분포의 차이로 인해 성능 저하가 발생하는 문제를 해결하기 위해.
  • 작은 크기의 얼굴와 혼잡한 얼굴을 고려하여 얼굴 검출에 특화된 검색 공간과 검색 전략을 설계하기 위해.
  • 다양한 피라미드 레이어 간의 희소한 상향 연결과 적응형 연산을 학습하는 것을 통해, 성능이 뛰어난 자동 FAE(AutoFAE) 아키텍처를 미분 가능 아키텍처 탐색을 통해 자동으로 탐색하기 위해.
  • AutoFAE와 ResNet 백본을 기반으로 한 슈퍼넷을 구축하여 다양한 효율성 제약 조건에 맞는 자동 모델 스케일링을 가능하게 하기 위해.
  • 다양한 얼굴 검출 벤치마크에서 새로운 최고 수준의 성능-효율성 트레이드오프를 달성하기 위해.

제안 방법

  • 작은 얼굴과 혼잡한 얼굴을 다룰 수 있도록 크로스 스케일 및 유사 스케일 연결에 중점을 둔 도메인 인식 검색 공간을 제안한다.
  • 다양한 피라미드 레이어 간의 희소한 상향 연결과 적응형 연산을 학습하는 AutoFAE를 탐색하기 위해 이중 최적화 기법을 적용한다.
  • ResNet 백본과 함께 AutoFAE를 통합한 슈퍼넷을 구축하고, 지연 시간 제약 조건 하에서 단일 경로 아키텍처를 유전 알고리즘으로 탐색한다.
  • 다양한 해상도의 추론과 표준 앵커 기반 헤드를 사용하여 다중 작업 손실 함수를 적용해 슈퍼넷과 파생된 모델을 훈련시킨다.
  • RetinaNet, FCOS, Faster R-CNN에 표준 FPN 대신 AutoFAE를 통합하여 COCO에서의 일반화 능력을 평가한다.
  • COCO와 WIDER Face 간의 데이터 분포 차이를 분석하기 위해 누적 분포 함수를 사용하여 도메인 특화된 FAE 설계의 필요성을 정당화한다.

실험 결과

연구 질문

  • RQ1일반 객체 검출에서 성공한 기존의 수작업으로 설계된 FAE 모듈들이 도메인 분포의 차이로 인해 얼굴 검출에 일반화되지 못하는 이유는 무엇인가?
  • RQ2작은 얼굴과 혼잡한 얼굴 등의 얼굴 검출의 고유한 과제를 고려해 신경망 아키텍처 탐색을 어떻게 조정하여 FAE 모듈을 특화할 수 있는가?
  • RQ3자동으로 탐색된 FAE 모듈(AutoFAE)이 기존의 수작업 FAE보다 얼굴 검출에서 성능이 뛰어나면서도 일반 객체 검출에 대한 일반화 능력을 유지할 수 있는가?
  • RQ4AutoFAE를 기반으로 훈련된 슈퍼넷을 다양한 하드웨어 제약 조건에 따라 스케일링했을 때 달성할 수 있는 성능-효율성 트레이드오프는 무엇인가?
  • RQ5AutoFAE는 얼굴 검출을 넘어 다른 검출기와 데이터셋으로의 일반화 능력이 어느 정도까지 유지되는가?

주요 결과

  • ASFD-D6는 WIDER Face 테스트에서 96.7/96.2/92.1 AP를 기록하며, 이는 이전의 모든 경쟁자들보다 유의미한 성능 향상을 보였다.
  • ASFD-D0는 VGA 해상도 이미지에서 3.1ms의 라이턴시로 V100 GPU에서 320FPS 이상의 추론 속도를 달성하여 높은 효율성을 입증했다.
  • COCO에서 RetinaNet, FCOS, Faster R-CNN에 적용했을 때 AutoFAE는 AP를 0.5–1.0 포인트 향상시켜 일반 객체 검출에 대한 강력한 일반화 능력을 입증했다.
  • COCO와 WIDER Face 간의 성능 격차는 주로 더 작은 상대적 얼굴 크기(55%의 얼굴가 0.02 이하의 스케일)와 더 높은 인스턴스 밀도(99%의 이미지에서 150개 이상의 얼굴) 때문이며, 이는 기존 FAE가 이를 처리하지 못하기 때문이다.
  • 발견된 AutoFAE는 희소한 상향 연결과 적응형 연산을 사용하며, 깊은 레이어에서만 dilated convolution을 적용함으로써 작은 얼굴와 가림된 얼굴에 더 나은 특징 집합을 가능하게 한다.
  • 슈퍼넷 기반의 모델 스케일링은 다양한 지연 시간 제약 조건에 맞는 7개의 별도의 검출기를 도출하였으며, 모두 뛰어난 성능-효율성 트레이드오프를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.