Skip to main content
QUICK REVIEW

[論文レビュー] Domain Adaptation with Soft-margin multiple feature-kernel learning beats Deep Learning for surveillance face recognition

Samik Banerjee, Sukhendu Das|arXiv (Cornell University)|Oct 5, 2016
Face recognition and analysis参考文献 31被引用数 5
ひとこと要約

本論文は、監視用顔認識のためのドメイン適応(DA)と組み合わせたソフトマージン多重特徴カーネル学習(SML-MFKC)フレームワークを提案し、実世界のデータセットにおいてディープラーニング手法を上回る性能を発揮する。この手法は、FR_SURVで56.44%、SCFaceで79.86%、ChokePointで85.59%のランク1認識率を達成し、低解像度、低コントラスト、照明の変動に対して優れた耐性を示す。

ABSTRACT

Face recognition (FR) is the most preferred mode for biometric-based surveillance, due to its passive nature of detecting subjects, amongst all different types of biometric traits. FR under surveillance scenario does not give satisfactory performance due to low contrast, noise and poor illumination conditions on probes, as compared to the training samples. A state-of-the-art technology, Deep Learning, even fails to perform well in these scenarios. We propose a novel soft-margin based learning method for multiple feature-kernel combinations, followed by feature transformed using Domain Adaptation, which outperforms many recent state-of-the-art techniques, when tested using three real-world surveillance face datasets.

研究の動機と目的

  • ギャラリーとプローブ画像の間で低解像度、低コントラスト、照明の変動が顕著な状況下でも顕著な性能低下が生じる監視用顔認識の長年の課題に対処する。
  • 制御された環境では優れた性能を示すが、実世界の監視環境におけるドメインシフトに弱いディープラーニングモデルの限界を克服する。
  • 最適なカーネル選択とドメイン適応を統合した、耐障害性の高い特徴学習と適応パイプラインを構築する。
  • 適切に設計された複数カーネル学習とソフトマージン最適化により、実際の監視データセットにおいて最先端のディープラーニングモデルを上回る性能を達成できることを示す。

提案手法

  • 監視画像から顔領域をきめ細かくクロップするために、Chehra顔検出器を用いて49個の顔面特徴点を抽出する。
  • ギャラリーおよびプローブ画像の前処理を実施し、コントラストや照明の差を低減する。
  • 凸最適化フレームワークを用いて特徴選択とカーネル組み合わせを同時に最適化するソフトマージン多重特徴カーネル学習(SML-MFKC)を実装する。
  • ドメインシフトを最小化することで、ギャラリー(ソース)ドメインとプローブ(ターゲット)ドメインの特徴分布を一致させる変換を用いてドメイン適応(DA)を実施する。
  • グラスマン多様体上でのパスベース手法を用い、ソースドメインとターゲットドメインの部分空間が一致する共通の潜在空間を推定する。
  • SML-MFKCとDAの各モジュールを統合した統一フレームワークを構築し、最終的な認識はカーネルベース分類器を用いて実行する。

実験結果

リサーチクエスチョン

  • RQ1ドメインシフトが顕著な状況下でも、ソフトマージン多重特徴カーネル学習アプローチがディープラーニングモデルを上回る性能を発揮できるか?
  • RQ2低品質な監視データにおいて、ギャラリーとプローブドメインの特徴分布を一致させる際、ドメイン適応が認識精度にどの程度寄与するか?
  • RQ3実世界の監視データセットにおいて、本手法は最先端のディープラーニングモデルと比較して、ランク1認識率、CMC、ROC性能のどの面でも優れているか?
  • RQ4ディープラーニングモデルは制御された環境では成功を収めるが、なぜ監視環境では失敗するのか?また、カーネルベースのアプローチはこの失敗を緩和できるか?

主な発見

  • 提案手法のSML-MFKCにDAを組み合わせたアプローチは、FR_SURVデータセットでランク1認識率56.44%を達成し、最良のディープラーニング手法(FaceNet + アライメントで36.53%)を顕著に上回った。
  • SCFaceデータセットでは79.86%のランク1正答率を達成し、次に優れた手法(VGG Face + DeepFaceで46.25%)を上回った。
  • ChokePointデータセットでは85.59%のランク1正答率を達成し、2番目に優れた手法(FaceNet + アライメントで69.86%)を上回った。
  • 図4および図5に示すように、CMCおよびROC曲線の観点から、本手法は3つのデータセットすべてにおいて、すべての比較手法を一貫して上回った。
  • シンプルなベースライン(DAなしのSML-MFKC)も非常に競争力があり、カーネル学習のコア部分が強力であることを示唆しているが、DAが性能向上に不可欠な貢献をしている。
  • FR_SURVデータセットは依然として最も挑戦的であり、すべての手法で最低の正答率を示しており、屋外監視環境の困難さとさらなる改善の必要性を浮き彫りにしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。