Skip to main content
QUICK REVIEW

[論文レビュー] Wildest Faces: Face Detection and Recognition in Violent Settings

Mehmet Kerim Yucel, Yunus Can Bilge|ArXiv.org|May 19, 2018
Face recognition and analysis参考文献 49被引用数 8
ひとこと要約

本論文は、極端なブラー、低解像度、顔の大きなポーズ変化、被覆、激しい顔の表情を特徴とする、極度に劣化した状況下での顔検出および顔認識のための大規模かつ公開可能なベンチマークとして、Wildest Faces データセットを紹介する。最先端のモデルですら、ショットレベル評価において顔認識の正確性が53%未満にとどまっていることから、現実世界の悪質な条件下に特化した耐障害性の高いモデルの開発が求められていることが示された。

ABSTRACT

With the introduction of large-scale datasets and deep learning models capable of learning complex representations, impressive advances have emerged in face detection and recognition tasks. Despite such advances, existing datasets do not capture the difficulty of face recognition in the wildest scenarios, such as hostile disputes or fights. Furthermore, existing datasets do not represent completely unconstrained cases of low resolution, high blur and large pose/occlusion variances. To this end, we introduce the Wildest Faces dataset, which focuses on such adverse effects through violent scenes. The dataset consists of an extensive set of violent scenes of celebrities from movies. Our experimental results demonstrate that state-of-the-art techniques are not well-suited for violent scenes, and therefore, Wildest Faces is likely to stir further interest in face detection and recognition research.

研究の動機と目的

  • 極端な視覚的劣化を伴う暴力的でストレスの高い顔の状況に焦点を当てた、公開可能なデータセットの不足に対処すること。
  • ブラー、低解像度、被覆などの現実世界の悪条件下での顔検出および顔認識の評価のためのベンチマークを提供すること。
  • 最先端のモデルと現実世界の暴力的状況の挑戦との間の性能ギャップを調査すること。
  • 極端な表情や画像劣化に対処できる耐障害性の高い顔認識モデルの研究を可能にすること。
  • ショットレベルのアノテーションと時間的評価プロトコルを提供することで、動画ベースの顔認識を支援すること。

提案手法

  • 暴力的な映画に登場する有名人のシーンから、2,186本の動画クリップを収集し、極端な顔の表情と視覚的劣化を捉える。
  • 境界ボックス、IDラベル、およびブラーの深刻度、スケール、被覆度などの属性を含む顔のアノテーションを実施。
  • MTCNNベースのアライメントを用いる・使わないで、VGGFace および CenterLoss モデルを用いて画像ベースの顔認識を評価。
  • 動画認識のためのフレームレベル特徴を統合するために、アテンションベースの時間的プーリング機構を提案。
  • 動画認識におけるシーケンスモデリングのため、LSTMアーキテクチャ(1層、2層、双方向)を訓練および比較。
  • 公平な比較のため、固定学習率 0.0001 と固定隠れ層サイズ 4096 を用いて RMSprop 最適化手法を採用。

実験結果

リサーチクエスチョン

  • RQ1最先端の顔認識モデルは、極端なブラーと被覆を伴う、著しく劣化した暴力的シーンデータに対して、どの程度の性能を示すか?
  • RQ2Wildest Faces データセットにおいて、顔アライメントは認識正確性をどの程度向上させるか?
  • RQ3深層学習モデルは、高い運動ブラーと動的な表情を伴う動画シーケンスにおいて、顔を効果的に認識できるか?
  • RQ4ショットレベルの顔認識において、アテンションベースの時間的プーリングは、標準的なLSTMアーキテクチャと比べてどの程度優れているか?
  • RQ5極端で現実世界の条件を想定したデータセット上で評価した場合、現在のモデルの性能限界は何か?

主な発見

  • アライメントを用いた最先端の画像ベース顔認識モデルは、Wildest Faces データセットで39.9%の正確性にとどまり、極端な条件下での顔認識性能の著しい低下を示している。
  • 画像ベースで最も高い性能を示した手法、CenterLoss にアライメントを適用した場合の正確性は39.9%、VGGFace にアライメントを適用した場合の正確性は39.7%であり、アライメントによる向上はわずかである。
  • 動画ベースの認識において、アテンションベースの時間的プーリング手法が最も高いショットレベル正確性(52.6%)を達成し、すべてのLSTMバリアントおよび多数決手法を上回った。
  • 1層LSTMは52.3%のショットレベル正確性を達成し、2層および双方向LSTMを上回った。これは、このデータに対して単純な時間的モデリングがより効果的である可能性を示唆している。
  • VGGFace のフレームレベル正確性は51.98%に達するが、ショットレベル正確性は49.5%に低下し、ショット内でのフレーム間の一貫性の欠如が示された。
  • 全体として、すべてのモデルがショットレベル認識で53%未満の正確性にとどまり、現実世界の暴力的状況における耐障害性の大きなギャップが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。