Skip to main content
QUICK REVIEW

[논문 리뷰] HAMBox: Delving into Online High-quality Anchors Mining for Detecting Outer Faces

Yang Liu, Xu Tang|arXiv (Cornell University)|2019. 12. 19.
Face recognition and analysis참고 문헌 31인용 수 16
한 줄 요약

이 논문은 HAMBox를 제안하며, 기존의 표준 앵커 매칭에서 간과되었던 높은 품질의 매칭되지 않은 앵커를 명시적으로 활용함으로써 얼굴 검출 성능을 향상시키는 온라인 고품질 앵커 마이닝 전략을 개발한다. 이로 인해 WIDER FACE, FDDB, AFW, PASCAL Face 등 다양한 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, WIDER FACE의 하드 서브셋에서 2.9%의 AP 향상을 기록하였다.

ABSTRACT

Current face detectors utilize anchors to frame a multi-task learning problem which combines classification and bounding box regression. Effective anchor design and anchor matching strategy enable face detectors to localize faces under large pose and scale variations. However, we observe that more than 80% correctly predicted bounding boxes are regressed from the unmatched anchors (the IoUs between anchors and target faces are lower than a threshold) in the inference phase. It indicates that these unmatched anchors perform excellent regression ability, but the existing methods neglect to learn from them. In this paper, we propose an Online High-quality Anchor Mining Strategy (HAMBox), which explicitly helps outer faces compensate with high-quality anchors. Our proposed HAMBox method could be a general strategy for anchor-based single-stage face detection. Experiments on various datasets, including WIDER FACE, FDDB, AFW and PASCAL Face, demonstrate the superiority of the proposed method. Furthermore, our team win the championship on the Face Detection test track of WIDER Face and Pedestrian Challenge 2019. We will release the codes with PaddlePaddle.

연구 동기 및 목표

  • 기존의 앵커 기반 얼굴 검출기에서 무시되던 높은 품질의 매칭되지 않은 앵커의 활용 부족 문제를 해결하기 위해.
  • 외부 얼굴—특히 소형 또는 대형 스케일 얼굴—의 검출 성능을 햖당하기 위해 높은 품질의 매칭되지 않은 앵커를 마이닝하고 보완함으로써 성능을 향상시키기 위해.
  • 이러한 높은 품질의 음성 앵커를 학습 중에 통합함으로써 분류 및 회귀 브랜치를 동시에 향상시키는 일반적이고 학습 가능한 전략을 개발하기 위해.
  • 표준 앵커 매칭 전략이 도전적인 추론 환경에서 높은 품질의 앵커의 잠재력을 충분히 활용하지 못한다는 것을 입증하기 위해.
  • 추가 학습 데이터나 복잡한 아키텍처 없이도 다양한 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 높은 IoU(교차율)를 가지나 정답 얼굴과 매칭되지 않은 앵커를 식별하고 보완하는 온라인 고품질 앵커 마이닝(HAMBox) 전략을 제안한다.
  • IoU 임계값 기반으로 학습 중에 외부 얼굴에 대해 높은 품질의 매칭되지 않은 앵커를 선택적으로 강화하는 동적 앵커 보완 메커니즘을 도입한다.
  • 보완된 앵커에 더 높은 주의를 기울이고 최적화 안정성을 향상시키기 위해 회귀 인식 포지티브 손실(RAL)을 사용하여 학습 샘플의 가중치를 재조정한다.
  • 다단계 학습 파이프라인을 활용: 첫째, 높은 품질의 매칭되지 않은 앵커 식별; 둘째, 이를 의사 양성 샘플로 보완; 셋째, RAL을 사용해 정밀도를 향상시키기 위해 미세조정.
  • 기존의 앵커 기반 단단계 얼굴 검출기(예: FPN 및 SSH를 사용하는 모델)에 원활하게 통합되며, 아키텍처의 대대적인 수정 없이도 가능하다.
  • 학습 및 추론 모두에서 이 전략을 적용하며, 특히 외부 얼굴의 예측 박스와 정답 박스 간의 IoU 향상에 중점을 둔다.

실험 결과

연구 질문

  • RQ1표준 학습 전략이 이들을 간과하고 있음에도 불구하고, 얼굴 검출에서 80% 이상의 정확한 예측 박스가 매칭되지 않은 앵커에서 유래하는 이유는 무엇인가?
  • RQ2높은 IoU를 가지나 양성 임계값 이하인 높은 품질의 매칭되지 않은 앵커를 효과적으로 활용할 수 있는가?
  • RQ3이러한 높은 품질의 매칭되지 않은 앵커를 보완하는 온라인 동적 앵커 마이닝 전략이, 특히 외부 얼굴에 대해 더 나은 일반화 및 정확도를 제공하는가?
  • RQ4보완된 앵커에 적용되었을 때, 제안된 회귀 인식 포지티브 손실(RAL)이 학습 안정성과 성능 향상에 어떻게 기여하는가?
  • RQ5HAMBox 전략이 아키텍처 변경 없이도 WIDER FACE, FDDB, AFW, PASCAL Face 등 다양한 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 추론 과정에서 정확하게 예측된 박스의 11%만이 매칭된 앵커에서 유래하며, 이는 높은 IoU를 가진 매칭되지 않은 앵커가 여전히 활용도가 낮음을 시사한다.
  • 학습 과정에서 전체 높은 품질의 앵커 중 65%가 매칭되지 않아, 강력한 회귀 잠재력을 지니고 있음에도 불구하고 앵커 활용에 큰 격차가 있음을 보여준다.
  • HAMBox 방법은 WIDER FACE 검증 세트의 쉬운 서브셋에서 97.0% AP, 중간에서 96.4% AP, 하드에서 93.3% AP를 기록하였으며, 하드 서브셋에서 이전 SOTA를 2.9% AP 향상시켰다.
  • WIDER FACE 테스트 세트에서는 쉬운 서브셋에서 95.9% AP, 중간에서 95.5% AP, 하드에서 92.3% AP를 달성하였으며, 하드 서브셋에서 이전 SOTA를 2.3% AP 향상시켰다.
  • 동일한 베이스라인에서 NAMS에 비해 6.4% AP 향상, ZCC에 비해 5.5% AP 향상하여, 앵커 활용도 및 검출 정확도 면에서 뛰어난 성능을 입증하였다.
  • 추가 모듈(SSH, DH, PA)을 통합한 최종 모델은 검증 세트에서 각각 97.0% (쉬움), 96.4% (중간), 93.3% (하드) AP를 기록하였고, 테스트 세트에서는 95.9%, 95.5%, 92.3%를 기록하여 다양한 벤치마크에서의 강건성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.