[논문 리뷰] Supervised Transformer Network for Efficient Face Detection
이 논문은 다중 작업 영역 제안 네트워크(RPN)와 RCNN을 계단식으로 연결하고, 끝에서 끝까지 학습 가능한 아키텍처로 통합한 감독형 트랜스포머 네트워크(STN)를 제안한다. RPN은 얼굴 후보 및 얼굴 특징점을 검출하며, 이는 감독형 변환층을 통해 표준 자세로 영역를 왜곡하는 데 사용된다. 두 단계의 특징 맵은 최종 분류를 위해 결합된다. 이 방법은 효율성을 위해 ROI 컨볼루션 기반 기술을 사용하여 VGA 해상도 이미지에서 단일 CPU 코어에서 30 FPS로 실행되며, 최신 기술 수준의 정확도를 달성한다.
Large pose variations remain to be a challenge that confronts real-word face detection. We propose a new cascaded Convolutional Neural Network, dubbed the name Supervised Transformer Network, to address this challenge. The first stage is a multi-task Region Proposal Network (RPN), which simultaneously predicts candidate face regions along with associated facial landmarks. The candidate regions are then warped by mapping the detected facial landmarks to their canonical positions to better normalize the face patterns. The second stage, which is a RCNN, then verifies if the warped candidate regions are valid faces or not. We conduct end-to-end learning of the cascaded network, including optimizing the canonical positions of the facial landmarks. This supervised learning of the transformations automatically selects the best scale to differentiate face/non-face patterns. By combining feature maps from both stages of the network, we achieve state-of-the-art detection accuracies on several public benchmarks. For real-time performance, we run the cascaded network only on regions of interests produced from a boosting cascade face detector. Our detector runs at 30 FPS on a single CPU core for a VGA-resolution image.
연구 동기 및 목표
- 실세계 얼굴 검출에서 큰 자세 변화 문제를 해결한다.
- 비면대면 및 도전적인 얼굴 자세에 대한 검출 정확도를 향상시킨다.
- 계산 비용을 줄여 CPU에서 실시간 추론을 가능하게 한다.
- 끝에서 끝까지 학습 가능한 새로운 감독형 변환층을 도입하여 최적의 표준 특징점 위치를 학습한다.
- ROI 기반 계산을 통해 최소한의 정확도 손실로 최신 기술 수준의 성능을 달성한다.
제안 방법
- 계단식 두 단계 네트워크: 첫 번째 단계로 얼굴 후보 및 얼굴 특징점을 예측하는 다중 작업 RPN.
- 검출된 특징점을 학습된 표준 위치로 매핑하는 감독형 변환층을 사용해 후보 영역를 왜곡한다.
- 왜곡된 영역는 두 번째 단계의 RCNN으로 분류되어 최종 얼굴/비얼굴 확인을 수행한다.
- 두 단계의 특징 맵을 결합하여 더 나은 분류 성능을 위한 통합 표현을 형성한다.
- 표준 특징점 위치는 학습 과정의 일부로 끝에서 끝까지 최적화된다.
- ROI 컨볼루션 기법은 DNN 연산을 검출된 관심 영역에만 국한시켜 CPU에서의 계산을 크게 줄인다.
실험 결과
연구 질문
- RQ1합성 검출과 정렬을 동시에 수행하는 계단식 CNN의 끝에서 끝까지 학습이 큰 자세 변화에 대한 강건성을 향상시킬 수 있는가?
- RQ2학습된 표준 자세를 학습하는 감독형 변환층이 비감독 또는 회귀 기반 정규화보다 우수한 성능을 낼 수 있는가?
- RQ3두 단계에서 유도된 다중 해상도 특징을 조합하면 최신 기술 수준의 정확도를 달성하면서도 실시간 성능을 유지할 수 있는가?
- RQ4ROI 기반 컨볼루션은 정확도 손실을 최소한으로 유지하면서 CPU에서 추론 시간을 얼마나 줄일 수 있는가?
- RQ5비상위 K 차단 기법이 NMS보다 더 많은 검출 정확도를 유지하면서 거짓 긍정을 줄이는 데 더 효과적인가?
주요 결과
- 제안된 감독형 트랜스포머 네트워크는 FDDB, AFW 및 PASCAL Faces 벤치마크에서 최신 기술 수준의 검출 정확도를 달성한다.
- ROI 컨볼루션을 사용하여 VGA 해상도 이미지에서 단일 CPU 코어에서 30 FPS로 실행된다.
- ROI 컨볼루션은 전체 이미지 추론 대비 최대 3배의 계산 감소를 이끌었으며, 정확도 손실율은 0.6%에 불과하다.
- 비상위 K 차단(K=5)은 동일한 후보 수에서 NMS(88.7%)보다 높은 89.4%의 정확도를 기록했다.
- 표준 특징점 위치의 끝에서 끝까지 학습은 특징의 분류 능력을 향상시켜 더 나은 얼굴/비얼굴 분리 성능을 가능하게 한다.
- 자세 보정 변환층 덕분에 극단적인 자세 변화 조건에서도 높은 정확도를 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.