Skip to main content
QUICK REVIEW

[論文レビュー] Grid Loss: Detecting Occluded Faces

Michael Opitz, Georg Waltner|arXiv (Cornell University)|Sep 1, 2016
Advanced Neural Network Applications参考文献 40被引用数 12
ひとこと要約

本稿では、特徴マップを空間グリッドに分割し、各グリッドブロックごとにハッジ損失を独立して最適化する新しいCNN損失層であるGrid Lossを紹介する。これにより、検出ウィンドウ内の個々の部分がより判別可能になり、実行時コストを増すことなく遮蔽に対するロバスト性が向上し、FDDB、PASCAL Faces、AFWの顔検出ベンチマークで最先端の性能を達成する。20 FPSのリアルタイム推論を実現している。

ABSTRACT

Detection of partially occluded objects is a challenging computer vision problem. Standard Convolutional Neural Network (CNN) detectors fail if parts of the detection window are occluded, since not every sub-part of the window is discriminative on its own. To address this issue, we propose a novel loss layer for CNNs, named grid loss, which minimizes the error rate on sub-blocks of a convolution layer independently rather than over the whole feature map. This results in parts being more discriminative on their own, enabling the detector to recover if the detection window is partially occluded. By mapping our loss layer back to a regular fully connected layer, no additional computational cost is incurred at runtime compared to standard CNNs. We demonstrate our method for face detection on several public face detection benchmarks and show that our method outperforms regular CNNs, is suitable for realtime applications and achieves state-of-the-art performance.

研究の動機と目的

  • 部分的遮蔽された顔をリアルタイムで検出する課題に対処すること。標準のCNNでは、非判別的な部分のため失敗する。
  • 検出ウィンドウの各部分領域が独立して判別可能であるようにすることで、遮蔽下での検出器のロバスト性を向上させること。
  • グリッド損失を通常の全結合層にマッピングすることで、計算効率を維持し、実行時オーバーヘッドを回避すること。
  • 過学習と特徴相関の低減を図りながら、ベンチマークデータセットで既存のCNNベースの顔検出器を上回ること。

提案手法

  • Grid Lossは、最終的な畳み込み特徴マップを空間的サブ領域(例:4x4または5x5のブロック)のグリッドに分割する。
  • 各グリッドセルに対してハッジ損失を独立して適用し、各局所領域が単独で顔検出に対して判別可能になるよう促進する。
  • 学習後、グリッド損失層を通常の全結合層にマッピングすることで、推論速度を保ち続ける。
  • 標準のCNNアーキテクチャと互換性があり、アーキテクチャの変更や追加の推論時計算を必要としない。
  • 本手法は、小規模および大規模なネットワークバージョンを用いて、FDDB、AFW、PASCAL Facesといった標準の顔検出ベンチマークで評価されている。
  • 本手法は、多様で空間的に独立した検出器を促進することで、特徴相関と過学習を低減することが示されている。

実験結果

リサーチクエスチョン

  • RQ1グリッドベースの損失を用いた学習は、標準のグローバル損失と比較して、部分的遮蔽顔の検出精度を向上させるか?
  • RQ2特徴マップにおける局所的判別性を強制することで、推論コストを増大させることなく遮蔽に対する耐性が向上するか?
  • RQ3標準ベンチマークにおいて、Grid Lossは最先端の顔検出器と比較して、精度と速度の面でどのように差をつけるか?
  • RQ4Grid Lossは、学習済みのCNNにおける特徴相関と過学習をどの程度低減するか?
  • RQ5CNNカスケードなどの既存手法と組み合わせることで、Grid Lossはさらなる性能向上を実現できるか?

主な発見

  • FDDBデータセットでは、高速モデルが0.1 FPPIで86.7%のリCALLを達成し、最先端技術を0.7%の真正陽性率向上で上回った。
  • 大規模モデルは、FDDBで0.1 FPPIで89.4%のリCALLを達成し、最先端の性能を示した。
  • PASCAL FacesおよびAFWでは、それぞれ1.38%および1.45%の平均適合率(AP)向上を達成し、従来の最先端技術を上回った。
  • 本手法は、カスケードや分離可能畳み込みなどの高速化技術に依存せず、標準のGPUハードウェアで20 FPSで動作する。
  • パラメータ評価およびアブレーションスタディにより、過学習と特徴相関が低減されていることが示された。
  • AlexNetと組み合わせた場合、FDDBで90.1%のリCALLを達成し、本手法の有効性と既存アーキテクチャとの相乗効果をさらに確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。