Skip to main content
QUICK REVIEW

[論文レビュー] Robust Face Detection via Learning Small Faces on Hard Images

Zhishuai Zhang, Wei Shen|arXiv (Cornell University)|Nov 28, 2018
Face recognition and analysis参考文献 40被引用数 7
ひとこと要約

本稿では、ハードな画像に焦点を当てたトレーニングと、1つの特徴マップとアンカーベースのネットワークによる小規模な顔に特化した学習により、検出が困難な小さな顔の検出を向上させるロバストな顔検出器を提案する。この手法は、WIDER FACEのエイジ、ミディアム、ハードサブセットでそれぞれ95.7、94.9、89.7のSOTA APを達成しており、従来のモデルと比較してより高速な推論と低いメモリ使用量を実現した。

ABSTRACT

Recent anchor-based deep face detectors have achieved promising performance, but they are still struggling to detect hard faces, such as small, blurred and partially occluded faces. A reason is that they treat all images and faces equally, without putting more effort on hard ones; however, many training images only contain easy faces, which are less helpful to achieve better performance on hard images. In this paper, we propose that the robustness of a face detector against hard faces can be improved by learning small faces on hard images. Our intuitions are (1) hard images are the images which contain at least one hard face, thus they facilitate training robust face detectors; (2) most hard faces are small faces and other types of hard faces can be easily converted to small faces by shrinking. We build an anchor-based deep face detector, which only output a single feature map with small anchors, to specifically learn small faces and train it by a novel hard image mining strategy. Extensive experiments have been conducted on WIDER FACE, FDDB, Pascal Faces, and AFW datasets to show the effectiveness of our method. Our method achieves APs of 95.7, 94.9 and 89.7 on easy, medium and hard WIDER FACE val dataset respectively, which surpass the previous state-of-the-arts, especially on the hard subset. Code and model are available at https://github.com/bairdzhang/smallhardface.

研究の動機と目的

  • 実世界のシナリオにおける小さな、ぼやけた、部分的遮断された顔の検出という、長年の課題に対処すること。
  • トレーニングデータに含まれる容易で高品質な顔に過剰適合するため、既存のアンカーベース検出器がハードな画像で性能を発揮できないという制限を克服すること。
  • すべてのサイズにわたるスケール不変検出ではなく、ハードな画像と小顔を優先して再重み付けすることでトレーニングを行うことにより、検出器のロバスト性を向上させること。
  • 小顔にのみ焦点を当てた軽量で、1つの特徴マップを持つ検出器を設計することで、ハードケースにおける学習効率と性能を向上させること。
  • 複数のベンチマークでSOTA性能を達成するとともに、高速な推論と低メモリ消費量を維持すること。

提案手法

  • 検出性能に基づいて難易度スコアを割り当てることで、各トレーニングエポックの前にハードな画像を再サンプリングする動的ハード画像マイニング戦略を提案する。
  • 1つの検出特徴マップを有するワンショットアンカーベース検出器を設計し、4×4から16×16までの小サイズアンカーを用いて、小顔にのみ焦点を当て、大きな顔を無視する。
  • 短辺が100ピクセルおよび300ピクセルの極端な小スケールを含むマルチスケールテスト戦略を実装し、計算コストをほとんど増加させずに、容易な顔や大きな顔の高精度検出を維持する。
  • VGG16のconv4_3およびconv5_3層からの特徴マップ統合に続き、次に次元削減とバイリニアアップサンプリングを実行し、高解像度の検出特徴マップを生成する。
  • 推論時に水平反転増強を統合することで、高速なペナルティを最小限に抑えつつ、ハードな顔の性能をさらに向上させる。
  • スケール変動に過剰適合しないように、ハードな画像と小顔を強調するカリキュラム学習的アプローチを用いて検出器をトレーニングする。

実験結果

リサーチクエスチョン

  • RQ1ハードな画像(少なくとも1つのハードな顔が含まれる)に焦点を当てたトレーニングが、小さな、ぼやけた、または遮断された顔の検出における検出器のロバスト性を向上させるか?
  • RQ21つの特徴マップ構造を用いて小顔にのみ学習させる検出器が、マルチスケールでスケール不変の検出器と比較して、ハードな顔の検出において優れた性能を発揮するか?
  • RQ3極端な小スケール(例:100および300ピクセル)を含むマルチスケールテストは、推論時間の増加を伴わず、容易な顔や大きな顔の検出精度をどの程度向上させるか?
  • RQ4シンプルで軽量な検出器アーキテクチャが、複雑なモデルと比較してGPUメモリ消費量が少なく、推論が速く、標準ベンチマークでSOTA性能を達成できるか?
  • RQ5動的ハード画像マイニングは、追加のパrameter や計算量を追加せずに、ハードケースにおける検出性能を向上させるために、トレーニングデータの再重み付けにどの程度有効か?

主な発見

  • 提案された検出器は、WIDER FACEバリデーションセットでSOTA性能を達成し、エイジ、ミディアム、ハードサブセットのAPがそれぞれ95.7、94.9、89.7であり、ハードサブセットで従来のSOTA手法を顕著に上回った。
  • 極端な小スケール(100および300ピクセル)をマルチスケールテストに含めることは極めて重要である:それらを除外すると、エイジセットのAPは95.7から78.2に低下し、容易な顔の検出におけるその役割が示された。
  • TITAN Xで1枚あたり0.84秒の推論時間で、WIDER FACEのハードサブセットで89.7のAPを達成し、SSH、S3FD、PyramidBoxを速度とメモリ効率の点で上回った。
  • GPUメモリ使用量はわずか5.3 GBであり、PyramidBoxの11.9 GBの半分で、より優れた性能を達成しており、優れたメモリ効率を示した。
  • 推論時に追加の小スケール(100および300ピクセル)を除外すると、推論時間はたった6.5%(1.59秒 vs. 1.70秒)しか増加しなかったため、小顔検出の高精度を維持しながらも、ほとんどコストがかからず、その影響が最小限であることが証明された。
  • この手法は一般化性に優れている:小顔にのみトレーニングされたにもかかわらず、マルチスケールテストにより大きな顔に対してもロバストに性能を発揮しており、1つの特徴マップ構造の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。