Skip to main content
QUICK REVIEW

[論文レビュー] Generative One-Shot Face Recognition

Zhengming Ding, Yandong Guo|arXiv (Cornell University)|Sep 28, 2019
Face recognition and analysis参考文献 46被引用数 9
ひとこと要約

本論文は、代表的な(ベース)クラスからのデータ変異を活用して、代表が不足している(ワンショット)クラスのためのリアルな訓練データを合成するGANベースのフレームワークを提案する。ジェネレータと分類器を統一されたミニマックス損失を通じて共同で訓練することで、ワンショットアイデンティティの特徴空間カバレッジが向上し、ワンショットクラスで99%の精度で94.98%のカバレッジを達成した。一方で、ベースクラスでは99.80%のTop-1精度を維持した。これは、MS-Celeb-1Mベンチマークで最先端の性能を達成した。

ABSTRACT

One-shot face recognition measures the ability to identify persons with only seeing them at one glance, and is a hallmark of human visual intelligence. It is challenging for conventional machine learning approaches to mimic this way, since limited data are hard to effectively represent the data variance. The goal of one-shot face recognition is to learn a large-scale face recognizer, which is capable to fight off the data imbalance challenge. In this paper, we propose a novel generative adversarial one-shot face recognizer, attempting to synthesize meaningful data for one-shot classes by adapting the data variances from other normal classes. Specifically, we target at building a more effective general face classifier for both normal persons and one-shot persons. Technically, we design a new loss function by formulating knowledge transfer generator and a general classifier into a unified framework. Such a two-player minimax optimization can guide the generation of more effective data, which effectively promote the underrepresented classes in the learned model and lead to a remarkable improvement in face recognition performance. We evaluate our proposed model on the MS-Celeb-1M one-shot learning benchmark task, where we could recognize 94.98% of the test images at the precision of 99% for the one-shot classes, keeping an overall Top1 accuracy at $99.80\%$ for the normal classes. To the best of our knowledge, this is the best performance among all the published methods using this benchmark task with the same setup, including all the participants in the recent MS-Celeb-1M challenge at ICCV 2017\footnote{http://www.msceleb.org/challenge2/2017}.

研究の動機と目的

  • 法執行縁や大規模な有名人認識などの実世界の応用において、1人当たり1枚の訓練画像からの顔認識という課題に対処すること。
  • 外部のデータ拡張に依存せずに、リアルで多様な訓練サンプルを合成することで、ワンショットクラスの一般化性能を向上させること。
  • 代表が豊富な(ベース)クラスの性能を損なわず、低ショットアイデンティティの認識精度を著しく向上させること。
  • 生成的データ拡張を通じて、特徴表現と分類器学習を統合的に最適化するフレームワークを構築すること。
  • 大規模顔認識におけるデータの不均衡を緩和するための生成的学習の有効性を検証すること。

提案手法

  • ジェネレータがベースクラスの顔のデータ分布をモデル化することで、ワンショットアイデンティティのための顔画像を合成する条件付きGANフレームワークを設計した。
  • ジェネレータと汎用分類器の訓練を統一した2人一揆ミニマックスゲームとして定式化した新しい損失関数を提案し、ベースクラスからワンショットクラスへの知識移転を可能にした。
  • ディスクラミネーターは、実際のベースクラス画像と生成されたワンショット風画像を区別するように訓練され、ジェネレータがよりリアルで判別性の高いサンプルを生成するように導く。
  • 分類器はジェネレータと共同で最適化され、ワンショットクラスのためのより良い特徴分離と改善された意思決定境界を促進する統一された目的関数を用いた。
  • 事前学習済みのResNet-34特徴量を入力とし、エンド・トゥ・エンドのファインチューニング中に提案された損失を適用することで、特徴の判別性を向上させた。

実験結果

リサーチクエスチョン

  • RQ1外部データに依存せずに、生成的データ拡張がワンショット顔認識性能を効果的に向上させることができるか?
  • RQ2GANをどのように訓練すれば、ベースクラスの視覚的変動を反映した意味のある、クラス固有の顔サンプルを合成できるか?
  • RQ3ジェネレータと分類器の共同最適化が、代表が不足しているクラスの一般化性能を向上させると同時に、代表が豊富なクラスの性能を維持できるか?
  • RQ4提案手法が、ワンショットアイデンティティの特徴空間カバレッジと意思決定境界推定をどの程度向上させるか?
  • RQ5標準評価プロトコルに従って、MS-Celeb-1Mのような大規模ベンチマークで最先端の性能を達成できるか?

主な発見

  • 提案モデルは、MS-Celeb-1Mベンチマークにおいて、ワンショットクラスで99%の精度で94.98%のカバレッジを達成し、先行手法を著しく上回った。
  • ベースクラスのTop-1精度は99.80%のままであり、ワンショット学習中に代表的アイデンティティの性能が損なわれていないことを示した。
  • 最適化後、ワンショット分類精度が77.01%から96.82%に向上した。これは、低ショットアイデンティティのための特徴空間の拡張が効果的に行ったことを示している。
  • ワンショットクラスの分類器重みベクトルのノルムが、ベースクラスの重み分布に収束した。これは、モデルの信頼性と一般化性能の向上を示唆している。
  • 低解像度、スケッチ、遮蔽された顔などの困難なケースにおいて、k-NNやSoftmaxを上回る性能を示した。これは、視覚的変動に対して高いロバスト性を有していることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。