[논문 리뷰] Robust Face Detection via Learning Small Faces on Hard Images
이 논문은 단일 특징맵 기반의 앵커 기반 네트워크를 통해 소형 얼굴에만 집중하여 훈련을 수행하고, 어려운 이미지에 초점을 맞춰 소형이지만 감지하기 어려운 얼굴의 검출 성능을 향상시키는 강건한 얼굴 검출기를 제안한다. 이 방법은 WIDER FACE의 쉬운, 중간, 어려운 서브셋에서 각각 95.7, 94.9, 89.7의 SoTA AP를 달성하며, 이전 모델보다 더 빠른 추론 속도와 낮은 메모리 사용량을 확보한다.
Recent anchor-based deep face detectors have achieved promising performance, but they are still struggling to detect hard faces, such as small, blurred and partially occluded faces. A reason is that they treat all images and faces equally, without putting more effort on hard ones; however, many training images only contain easy faces, which are less helpful to achieve better performance on hard images. In this paper, we propose that the robustness of a face detector against hard faces can be improved by learning small faces on hard images. Our intuitions are (1) hard images are the images which contain at least one hard face, thus they facilitate training robust face detectors; (2) most hard faces are small faces and other types of hard faces can be easily converted to small faces by shrinking. We build an anchor-based deep face detector, which only output a single feature map with small anchors, to specifically learn small faces and train it by a novel hard image mining strategy. Extensive experiments have been conducted on WIDER FACE, FDDB, Pascal Faces, and AFW datasets to show the effectiveness of our method. Our method achieves APs of 95.7, 94.9 and 89.7 on easy, medium and hard WIDER FACE val dataset respectively, which surpass the previous state-of-the-arts, especially on the hard subset. Code and model are available at https://github.com/bairdzhang/smallhardface.
연구 동기 및 목표
- 실세계 환경에서 소형, 흐린, 가림을 입은 얼굴을 지속적으로 감지하는 데 도전하는 문제를 해결한다.
- 훈련 데이터에서 쉽게 감지 가능한 고화질 얼굴에 과적합되는 기존 앵커 기반 검출기의 한계를 극복한다.
- 모든 크기에서 尺도 불변 검출을 하기보다는, 어려운 이미지와 소형 얼굴에 우선순위를 두어 재가중 훈련을 통해 검출기의 강건성을 향상시킨다.
- 소형 얼굴에만 집중하는 경량의 단일 특징맵 검출기를 설계하여 학습 효율성과 어려운 케이스에서의 성능을 향상시킨다.
- 다양한 벤치마크에서 SoTA 성능을 달성하면서도 빠른 추론 속도와 낮은 메모리 소비를 유지한다.
제안 방법
- 검출 성능에 기반해 훈련 이미지의 난이도 점수를 할당하는 동적 하드 이미지 마이닝 전략을 제안하여, 각 훈련 에포크 전에 하드 이미지를 재샘플링한다.
- 단일 검출 특징맵을 사용하는 단일 스풍경 앵커 기반 얼굴 검출기를 설계하여, 소형 앵커(예: 4×4에서 16×16)를 사용해 소형 얼굴에만 집중하고 대형 얼굴은 무시한다.
- 단순한 계산 비용 증가 없이도 쉬운 얼굴과 대형 얼굴의 정확도를 유지하기 위해, 짧은 변이 100 및 300 픽셀과 같은 극단적인 소형 스케일을 포함한 다중 스케일 테스트 전략을 구현한다.
- VGG16의 conv4_3 및 conv5_3 레이어에서 특징 병합을 수행한 후, 차원 감소 및 이중선형 업샘플링을 통해 고해상도 검출 특징맵을 생성한다.
- 추론 중 수평 반전 증강을 통합하여, 소형 얼굴이 흐리거나 가려진 경우의 성능을 최소한의 속도 저하로 추가로 향상시킨다.
- 스케일 변동에 과적합되지 않도록, 하드 이미지와 소형 얼굴에 중점을 두고, 교과서처럼 단계적으로 학습하는 접근 방식을 사용해 훈련한다.
실험 결과
연구 질문
- RQ1하드 이미지(최소 하나의 하드 얼굴을 포함하는 이미지)에 훈련을 집중시키는 것이 소형, 흐린, 가려진 얼굴의 검출 강건성 향상에 기여하는가?
- RQ2단일 특징맵 아키텍처를 통해 소형 얼굴에만 집중하는 검출기가, 다중 스케일 및 尺도 불변 검출을 수행하는 검출기보다 하드 얼굴 검출에서 더 우수한 성능을 내는가?
- RQ3극단적인 소형 스케일 테스트(예: 100 및 300 픽셀)는 추론 시간 증가 없이 쉬운 얼굴과 대형 얼굴의 검출 정확도를 얼마나 향상시키는가?
- RQ4간단하고 경량의 검출기 아키텍처가 복잡한 모델보다 더 적은 GPU 메모리와 더 빠른 추론을 유지하면서도 표준 벤치마크에서 SoTA 성능을 달성할 수 있는가?
- RQ5동적 하드 이미지 마이닝은 추가 파rameter나 계산 비용 없이도 하드 케이스 검출 성능 향상에 얼마나 효과적인가?
주요 결과
- 제안된 검출기는 WIDER FACE 검증 세트에서 SoTA 성능을 달성하여, 쉬운 서브셋에서 95.7, 중간 서브셋에서 94.9, 어려운 서브셋에서 89.7의 AP를 기록하며, 특히 어려운 서브셋에서 이전 SoTA 방법보다 뚜렷이 뛰어난 성능을 보였다.
- 극단적인 소형 스케일(100 및 300 픽셀)을 다중 스케일 테스트에 포함시키는 것이 핵심적이다: 이 스케일을 제거하면 쉬운 서브셋의 AP가 95.7에서 78.2로 감소하여, 쉬운 얼굴을 감지하는 데 이들의 기여도를 확인한다.
- Titan X에서 이미지당 추론 시간이 0.84초인 모델은 WIDER FACE의 어려운 서브셋에서 89.7의 AP를 달성하며, SSH, S3FD, PyramidBox보다 빠른 속도와 높은 메모리 효율성을 확보했다.
- 모델은 오직 5.3 GB의 GPU 메모리만 사용하며, 이는 PyramidBox(11.9 GB)의 절반에 불과하지만 더 뛰어난 성능을 달성하여 뛰어난 메모리 효율성을 입증한다.
- 추론에서 추가적인 소형 스케일(100 및 300 픽셀)을 제거해도 추론 시간이 6.5%만 증가(1.59s 대비 1.70s)하여, 소형 얼굴에 대한 높은 정확도를 유지하면서도 거의 영향을 주지 않는 것으로 확인되었다.
- 이 방법은 잘 일반화된다: 소형 얼굴에만 훈련된 모델이 다중 스케일 테스트를 통해 대형 얼굴에 대해서도 강건하게 성능을 발휘함으로써, 단일 특징맵 아키텍처의 효과성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.