Skip to main content
QUICK REVIEW

[論文レビュー] Detecting and counting tiny faces

Alexandre Attia, Sharone Dayan|arXiv (Cornell University)|Jan 19, 2018
Advanced Image and Video Retrieval Techniques参考文献 12被引用数 4
ひとこと要約

本論文は、焦点化記述子とマルチスケール特徴統合を用いたスケール不変型顔検出法を提案し、極小顔の検出に成功し、WIDERFACEのエイジルセットで87%のAPを達成した。本手法は、顔埋め込みとSVMベースのマッチングを組み合わせることで、公共のデモにおける個々の人物の数え上げに応用され、テストクリップで95–98%の精度を達成した。

ABSTRACT

Finding Tiny Faces (by Hu and Ramanan) proposes a novel approach to find small objects in an image. Our contribution consists in deeply understanding the choices of the paper together with applying and extending a similar method to a real world subject which is the counting of people in a public demonstration.

研究の動機と目的

  • 公共のデモにおける人物数のリアルタイムカウントに、Tiny Facesアルゴリズムを適用すること。
  • 動画シーケンスにおける極小、重複、または隠蔽された顔の検出と、一意な識別を困難にしている課題に対処すること。
  • 顔検出、埋め込み、フレーム間マッチングを組み合わせたスケーラブルなパイプラインの開発。
  • 実世界の動画データに対して、Tiny Facesと最先端の検出器(例:MT-CNN、Faster R-CNN)の性能を比較評価すること。
  • 低解像度およびぼやけた画像下での手法の限界を検討し、将来の訓練と一般化のための改善策を提案すること。

提案手法

  • スケール固有の検出器をリスケールされた入力に適用するマルチスケール推論パイプラインを用い、スケール不変性を確保する。
  • 複数のCNN層からのハイパーカラム特徴に対して、固定サイズの受容 field(291px)を用いた焦点化記述子を適用し、局所的詳細とグローバルコンテキストを符号化する。
  • 重複する検出結果を統合し、誤検出を低減するために、元解像度で非最大抑制(NMS)を適用する。
  • モデルの学習が失敗したため、特徴抽出および推論に事前学習済みのResNet101バックボーンを採用した。
  • 顔のアライメントに、事前学習済みのランドマーク検出器とアフィン変換を用い、顔の向きを標準化する。
  • 事前学習済みのCNNを用いて128次元の顔埋め込みを生成し、データオーギュメンテーション(ノイズ、色のずれ)を施した線形SVMを用いてフレーム間の顔マッチングを実行する。

実験結果

リサーチクエスチョン

  • RQ1Tiny Facesアルゴリズムは、極小、重複、隠蔽された顔を含む実世界の動画データに対して、どの程度の性能を示すか?
  • RQ2焦点化記述子に基づく検出は、動的な動画シーケンスにおける人物カウントに効果的に拡張可能か?
  • RQ3実用的状況下でのTiny Facesの検出性能に、画像解像度とぼやけ具合が及ぼす影響は何か?
  • RQ4限られた学習データでSVMベースの顔マッチングが、フレーム間の個々の人物カウントにどの程度効果的か?
  • RQ5動画ベースのカウントタスクにおいて、Tiny Facesモデルは他の最先端顔検出器(例:MT-CNN、Faster R-CNN)と比較して、精度と速度の点でどの程度優れているか?

主な発見

  • Tiny Facesモデルは、WIDERFACEのエイジルセットで87%の平均精度(AP)を達成したが、元論文の92%と比較するとやや性能が低下しており、再実装における強い性能を示しているが若干の劣化が認められた。
  • 画像解像度が低下するにつれて性能が著しく低下し、特に小さな顔では検出の再現率が低下し、Jaccard類似度も低下した。
  • 顔が著しくぼやけた画像では、アルゴリズムの性能が著しく低下し、画像品質およびぼやけのアーティファクトに敏感であることが示された。
  • パレードカテゴリ(平均34顔/フレーム)では、Tiny Facesが93%のTP/GTを達成し、MT-CNN(82%)およびFaster R-CNN(77%)を大きく上回った。
  • 人物カウントパイプラインは、クリップ1(139件の正例)で98%のAP、クリップ2(148件の正例)で95%のAPを達成し、個々の人物の識別において高い精度を示した。
  • データオーギュメンテーション(ノイズ、色のずれ)とクロスバリデーションによるしきい値設定を施したSVMベースのマッチングにより、精度が向上し、誤検出の制御を最適化するためF₀.₅スコアが使用された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。