Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Branch Fully Convolutional Network for Face Detection

Yancheng Bai, Bernard Ghanem|arXiv (Cornell University)|2017. 07. 20.
Face recognition and analysis참고 문헌 27인용 수 3
한 줄 요약

이 논문은 다양한 얼굴 크기에서 단일 스텝 추론을 가능하게 하기 위해 다수의 컨volution 레이어에서 유도된 스케일별 스킵 커넥션을 활용하는 멀티브랜치 풀 컨volution 네트워크(MB-FCN)를 제안한다. 이 방법은 FDDB 및 WIDER FACE에서 최신 기술 수준의 성능을 달성하며, 특히 도전적인 하드 서브셋에서 뛰어난 성능을 보이며, 640×480 이미지에서 최소 탐지 가능한 얼굴 크기의 가정 없이도 15 FPS로 실행된다.

ABSTRACT

Face detection is a fundamental problem in computer vision. It is still a challenging task in unconstrained conditions due to significant variations in scale, pose, expressions, and occlusion. In this paper, we propose a multi-branch fully convolutional network (MB-FCN) for face detection, which considers both efficiency and effectiveness in the design process. Our MB-FCN detector can deal with faces at all scale ranges with only a single pass through the backbone network. As such, our MB-FCN model saves computation and thus is more efficient, compared to previous methods that make multiple passes. For each branch, the specific skip connections of the convolutional feature maps at different layers are exploited to represent faces in specific scale ranges. Specifically, small faces can be represented with both shallow fine-grained and deep powerful coarse features. With this representation, superior improvement in performance is registered for the task of detecting small faces. We test our MB-FCN detector on two public face detection benchmarks, including FDDB and WIDER FACE. Extensive experiments show that our detector outperforms state-of-the-art methods on all these datasets in general and by a substantial margin on the most challenging among them (e.g. WIDER FACE Hard subset). Also, MB-FCN runs at 15 FPS on a GPU for images of size 640 x 480 with no assumption on the minimum detectable face size.

연구 동기 및 목표

  • 극단적인 크기, 자세, 표정 및 가림 상태의 변동에서 얼굴을 탐지하는 과제를 해결하기 위해.
  • 얕은 세밀한 특징과 깊은 거시적 특징을 융합하여 소형 얼굴의 탐지 정확도를 향상시키기 위해.
  • 다중 크기 이미지 피라미드가 필요 없게 하여 계산 효율성을 향상시키기 위해.
  • 단일 순환 처리를 통해 모든 크기 범위에서 높은 성능을 달성하기 위해.
  • 실시간 추론 속도를 유지하면서도 최소 탐지 가능한 얼굴 크기의 가정을 제거하기 위해.

제안 방법

  • MB-FCN 아키텍처는 각각 특정 크기 범위 내의 얼굴 탐지를 전담하는 다수의 브랜치를 사용한다.
  • 각 브랜치는 공간적 및 의미적 수준에서 특징을 융합하기 위해 다양한 컨볼루션 레이어에서 유도된 스킵 커넥션을 활용한다.
  • 해상도가 높은 얕은 특징과 의미 정보가 풍부한 깊은 특징을 융합하여 소형 얼굴을 더 효과적으로 표현한다.
  • 각 위치의 분류 및 바운딩 박스 회귀를 위해 풀 컨볼루션 헤드를 사용한다.
  • 모든 브랜치에 걸쳐 비최대 억제(NMS)를 적용하여 탐지 결과를 통합하고 최종 결과를 도출한다.
  • 모델은 WIDER FACE에서 끝내기로 훈련되고, WIDER FACE 및 FDDB 벤치마크에서 평가된다.

실험 결과

연구 질문

  • RQ1단일 스텝, 멀티브랜치 FCN 아키텍처가 다중 크기 피라미드 방법보다 얼굴 탐지 정확도와 효율성에서 뛰어나게 되는가?
  • RQ2얕은 특징과 깊은 특징을 융합하면 소형 얼굴 탐지에 어떻게 기여하는가?
  • RQ3스케일별 스킵 커넥션은 WIDER FACE 하드 서브셋과 같은 도전적인 서브셋에서 성능 향상에 기여하는가?
  • RQ4이미지 피라미드를 제거할 경우 정확도와 추론 속도 사이의 상충 관계는 어떠한가?
  • RQ5최소 얼굴 크기의 가정이 없는 것이 탐지 성능에 얼마나 큰 영향을 미치는가?

주요 결과

  • MB-FCN 탐지기는 FDDB 및 WIDER FACE 양쪽 모두에서 최신 기술 수준의 성능를 달성하였으며, CMS-RCNN 대비 WIDER FACE 하드 서브셋에서 14.0%의 절대적 성능 향상을 보였다.
  • WIDER FACE 하드 서브셋에서 MB-FCN는 FDDB에서 미세조정된 모델들조차도 초월하였으며, 이는 WIDER FACE에서만 훈련되었음에도 불구하고 성능을 높이기 위한 노력의 결과로 볼 수 있다.
  • 640×480 이미지에서 GPU 기반으로 15 FPS로 실행되며, 최소 탐지 가능한 얼굴 크기의 가정이 없다.
  • 스케일별 스킵 커넥션의 사용은 소형 얼굴 탐지 성능 향상에 크게 기여하였으며, 이는 소형 크기 벤치마크에서 뛰어난 성능으로 입증되었다.
  • 다중 크기 추론 전략(MB-FCN-ms)은 더 높은 정확도(+4.0%의 하드 서브셋 향상)를 달성했지만, 다섯 배 느린 속도로 실행되어 단일 순환 설계의 효율성을 확인시켰다.
  • 정성적 결과는 극단적인 자세, 가림, 표정을 가진 얼굴의 강력한 탐지 능력을 보였지만, 심하게 잘린 또는 해상도가 낮은 얼굴에서는 실패가 발생하는 경우가 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.