Skip to main content
QUICK REVIEW

[論文レビュー] DSFD: Dual Shot Face Detector

Jian Li, Yabiao Wang|arXiv (Cornell University)|Oct 24, 2018
Face recognition and analysis参考文献 38被引用数 8
ひとこと要約

本稿では、特徴強化モジュール(FEM)を用いて特徴表現を向上させるデュアルショット顔検出器DSFDを提案する。DSFDは、2つの特徴ストリームに跨るマルチスケールの監視を可能にするプログレッシブアンカーロス(PAL)を採用し、より良い回帰器初期化を実現するための改善型アンカーマッチング(IAM)を用いる。DSFDは、WIDER FACE(Easyで96.6% AP、Hardで90.4%)およびFDDB(1,000 FPsで86.2%)で最先端の性能を達成し、スケール、被覆、照明の変動に対して高いロバスト性を示す。

ABSTRACT

In this paper, we propose a novel face detection network with three novel contributions that address three key aspects of face detection, including better feature learning, progressive loss design and anchor assign based data augmentation, respectively. First, we propose a Feature Enhance Module (FEM) for enhancing the original feature maps to extend the single shot detector to dual shot detector. Second, we adopt Progressive Anchor Loss (PAL) computed by two different sets of anchors to effectively facilitate the features. Third, we use an Improved Anchor Matching (IAM) by integrating novel anchor assign strategy into data augmentation to provide better initialization for the regressor. Since these techniques are all related to the two-stream design, we name the proposed network as Dual Shot Face Detector (DSFD). Extensive experiments on popular benchmarks, WIDER FACE and FDDB, demonstrate the superiority of DSFD over the state-of-the-art face detectors.

研究の動機と目的

  • スケール、ポーズ、被覆、照明の変動が極めて顕著な状況下での顔検出の課題に対処すること。
  • 特徴レベル間での識別性とロバスト性を向上させることで、ワンショット検出器における特徴学習を改善すること。
  • プログレッシブロスおよびアンカーマッチング戦略を通じて、クラス不均衡の緩和と回帰器初期化の改善を図ること。
  • 高い推論速度を維持しつつ、ワンステージ顔検出で最先端の精度を達成すること。

提案手法

  • 拡張畳み込みとリプルサル接続を用いてマルチレベル特徴を融合する特徴強化モジュール(FEM)を導入し、2番目の検出ストリームの表現を向上させる。
  • 最初のショットでは小さなアンカーサイズ、2番目のショットでは大きなアンカーサイズを適用するプログレッシブアンカーロス(PAL)を提案し、検出レベルおよびショット間での段階的監視を可能にする。
  • アンカーパartitioningとアンカーベースのデータ拡張を統合することで、正例アンカーの割り当てと回帰器初期化を改善する改善型アンカーマッチング(IAM)を設計する。
  • 最初のストリームは元の特徴、2番目のストリームは強化された特徴を用いる2ストリーム検出アーキテクチャを採用し、両者をPALで監視する。
  • VGG/ResNetバックボーンに、最後の畳み込みブロックの直後にFEMを挿入し、2番目の検出ストリーム用に強化された特徴を生成する。
  • 画像ピラミッドを用いたマルチスケール推論と、FDDB評価のための後処理楕円回帰を適用する。

実験結果

リサーチクエスチョン

  • RQ1強化された特徴学習を備えたデュアルショット検出フレームワークは、挑戦的な顔検出ベンチマークでの性能向上を実現できるか?
  • RQ22つの検出ショットに跨るプログレッシブロス設計は、より良い特徴学習と検出精度をもたらすか?
  • RQ3データ拡張とパーティショニングを用いた改善型アンカーマッチングは、初期化バイアスを低減させ、回帰器性能を向上させられるか?
  • RQ4提案手法は、精度とロバスト性の観点から、最先端のワンステージ顔検出器と比較してどのように差をつけるか?

主な発見

  • WIDER FACEバリデーションセットのEasyセットでは96.6%の平均適合率(AP)、Mediumセットでは95.7%、Hardセットでは90.4%を達成した。
  • WIDER FACEテストセットでは、Easyで96.0% AP、Mediumで95.3%、Hardで90.0%を達成し、先行する最先端手法を上回った。
  • FDDBベンチマークでは、1,000の偽陽性で連続的(continuous)なROC曲線で86.2%、不連続的(discontinuous)なROC曲線で99.1%の性能を達成した。
  • 追加のアノテーションを用いることで、DSFDの偽陽性率はさらに低下し、FDDBにおいてすべての他の手法を上回った。
  • より大きなバッチサイズ(LargeBS)を用いることで、WIDER FACEのHardセットで91.2%のAPを達成し、データ拡張下でも強い汎化性能を示した。
  • ResNet-50バックボーンを用いて、1台のNVIDIA P40 GPUでVGA解像度入力に対して22 FPSで動作し、高い推論効率を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。