Skip to main content
QUICK REVIEW

[論文レビュー] Frankenstein: Learning Deep Face Representations using Small Data

Guosheng Hu, Xiaojiang Peng|arXiv (Cornell University)|Mar 21, 2016
Face recognition and analysis参考文献 57被引用数 8
ひとこと要約

本論文では、実際の顔画像から顔の部分(目、鼻、口)を合成して、深層顔認識のための大規模な合成学習データを生成するデータ合成手法Frankensteinを提案する。10,000枚の実際の画像に合成顔を追加して学習させたCNNモデルが、500,000枚の画像で学習したモデルと同等の性能を達成し、LDA特徴マッピングを用いた際にはCASIA NIR-VIS2.0データセットで85.05%の正確度を達成し、新たなSOTAを樹立した。

ABSTRACT

Deep convolutional neural networks have recently proven extremely effective for difficult face recognition problems in uncontrolled settings. To train such networks, very large training sets are needed with millions of labeled images. For some applications, such as near-infrared (NIR) face recognition, such large training datasets are not publicly available and difficult to collect. In this work, we propose a method to generate very large training datasets of synthetic images by compositing real face images in a given dataset. We show that this method enables to learn models from as few as 10,000 training images, which perform on par with models trained from 500,000 images. Using our approach we also obtain state-of-the-art results on the CASIA NIR-VIS2.0 heterogeneous face recognition dataset.

研究の動機と目的

  • 大規模なラベル付きデータセットが入手できない分野、特に近赤外(NIR)画像分野において、顔認識のための深層CNNを学習する課題に対処すること。
  • 小規模な学習データ環境におけるモデルの過学習を引き起こすデータ不足問題を克服すること。
  • アイデンティティおよび意味的整合性を保ちながら、多様で現実的な顔画像を生成するデータ拡張技術を開発すること。
  • 顔の部分を組み合わせることで合成データを生成し、最小限の実データを用いて高性能な顔認識を実現すること。
  • 巨額の実データを必要とせずに、CASIA NIR-VIS2.0のような異種顔認識ベンチマークで最先端の性能を達成すること。

提案手法

  • 本手法は、2枚の実際の顔画像から顔の部分(目、鼻、口)を自動で検出し、抽出する。
  • 異なる被験者からのこれらの部分を、解剖学的に妥当な固定空間配置を用いて合成し、一貫性のある新しい顔画像を生成する。
  • 合成データ生成プロセスは完全に自動化されており、3次元顔モデルや手動アノテーションを必要としない。
  • 可視光とNIR画像間のドメインギャップを低減するために、LSSF(局所自己適応特徴)正規化とデータ統合を組み合わせる。
  • 生成された画像を用いて深層CNNを学習し、LFWおよびCASIA NIR-VIS2.0データセットで性能を評価する。
  • LDAによる特徴マッピングを適用することで、合成データおよび実データの認識正確度をさらに向上させる。

実験結果

リサーチクエスチョン

  • RQ1実際の顔画像から部分を合成して生成した合成データが、最小限の実データで深層CNNの顔認識を効果的に学習できるか?
  • RQ2大規模な実データセットで学習したモデルと比較して、合成データで学習したモデルの汎化性能および正確度はどの程度か?
  • RQ3合成データが、異種顔認識における可視光と近赤外画像間のドメインギャップをどの程度縮小できるか?
  • RQ4元のデータと合成データを統合することで、単独で使用する場合よりも認識性能が向上するか?
  • RQ5本手法が、巨額の実データを必要とせずに、CASIA NIR-VIS2.0のようなベンチマークデータセットで最先端の性能を達成できるか?

主な発見

  • 10,000枚の実画像に合成顔を追加して学習したCNNは、CASIA NIR-VIS2.0データセットで68.97%の顔認識正確度を達成し、500,000枚の画像で学習したモデルと同等の性能を示した。
  • LSSF正規化の適用により、可視光とNIR画像間のドメインギャップが低減され、未学習のNIR画像に対する汎化性能が38.45%から66.37%に向上した。
  • 元のLFWデータと合成LFWデータの特徴を統合することで、認識正確度が66.37%から68.97%に向上し、データ多様性の有効性が裏付けられた。
  • LDAによる特徴マッピングを適用した結果、CASIA NIR-VIS2.0データセットで85.05%の正確度を達成し、先行研究のSOTAを3.2ポイント上回った。
  • メトリック学習を用いない状況では、手作業で設計された記述子手法(C-CBFD)と比較して23.35ポイントの正確度向上(79.96% vs. 56.6%)を達成した。
  • Gabor特徴とRBMを用いた最良の報告手法(86.2%)と比較して、フィードフォワードCNNベースの高速な推論パイプラインを備えており、競争力のある性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。