Skip to main content
QUICK REVIEW

[論文レビュー] On the Capacity of Face Representation

Sixue Gong, Vishnu Naresh Boddeti|arXiv (Cornell University)|Sep 29, 2017
Face recognition and analysis参考文献 3被引用数 13
ひとこと要約

本稿では、顔埋め込みを高次元空間内の多様体としてモデル化することで、顔認識表現の容量を推定する幾何学的フレームワークを提案する。熟練的不確実性(エピステミックノイズ)とアレアトリックノイズ(データレベルの外見やポーズの違い)を考慮している。FaceNetとSphereFaceの容量は、それぞれ1%の誤認証率(FAR)で27,000および840,000人までの識別を可能と推定され、より厳しい閾値では急激に低下する。

ABSTRACT

In this paper we address the following question, given a face representation, how many identities can it resolve? In other words, what is the capacity of the face representation? A scientific basis for estimating the capacity of a given face representation will not only benefit the evaluation and comparison of different representation methods, but will also establish an upper bound on the scalability of an automatic face recognition system. We cast the face capacity problem in terms of packing bounds on a low-dimensional manifold embedded within a deep representation space. By explicitly accounting for the manifold structure of the representation as well two different sources of representational noise: epistemic (model) uncertainty and aleatoric (data) variability, our approach is able to estimate the capacity of a given face representation. To demonstrate the efficacy of our approach, we estimate the capacity of two deep neural network based face representations, namely 128-dimensional FaceNet and 512-dimensional SphereFace. Numerical experiments on unconstrained faces (IJB-C) provides a capacity upper bound of $2.7 imes10^4$ for FaceNet and $8.4 imes10^4$ for SphereFace representation at a false acceptance rate (FAR) of 1%. As expected, capacity reduces drastically at lower FARs. The capacity at FAR of 0.1% and 0.001% is $2.2 imes10^3$ and $1.6 imes10^{1}$, respectively for FaceNet and $3.6 imes10^3$ and $6.0 imes10^0$, respectively for SphereFace.

研究の動機と目的

  • 実験的評価に依存しない、顔認識表現が解明可能な最大識別者数を推定する科学的・分析的手法を確立すること。
  • 顔認識システムのスケーラビリティの限界を、表現容量の理論的上限として定義すること。
  • 顔認識表現空間を、高次元空間に埋め込まれた低次元多様体としてモデル化し、モデルの不確実性とデータのばらつきの両方を組み込むこと。
  • データセットに依存しない指標を提供し、顔表現手法の内在的容量を比較可能にするもの。
  • 非制約的データセット上での最先端の深層顔埋め込み(FaceNetとSphereFace)を用いて、フレームワークの有効性を実証すること。

提案手法

  • 顔全体の表現空間とクラス固有の埋め込みを、多変量正規分布を仮定した高次元空間内の超楕円体としてモデル化する。
  • 熟練的不確実性(モデルの限界)とアレアトリック変動(顔の外見やポーズのデータレベルの差異)という2つのノイズ源を考慮する。
  • 容量を、母集団の超楕円体の体積をクラス固有の超楕円体の体積で割った比として推定し、望ましい誤認証率(FAR)に合わせて補正する。
  • IJB-Cデータセット上で数値推定を実施し、超球、軸に平行な超楕円体、一般の超楕円体という異なる多様体形状の仮定に基づく容量の上限を計算する。
  • 11,000人の代表的サンプルを用いた簡略化された多様体サポートモデルを導入し、母集団レベルの不確実性を推定する。
  • 幾何的仮定の違いを比較し、非対称な超楕円体が等方的または軸に平行な近似よりも顕著に高い容量を示すことで、アプローチの妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1指定された誤認証率における、ある顔認識表現が解明可能な識別者の理論的上限は何か?
  • RQ2熟練的不確実性とアレアトリックノイズの両方が、高次元埋め込み空間における顔認識表現の容量にどのように影響を与えるか?
  • RQ3埋め込み多様体の幾何的構造——特にその形状と体積——が、顔認識システムのスケーラビリティにどのように寄与するか?
  • RQ4超球と超楕円体などの異なる多様体形状の仮定が、容量推定にどの程度影響を与えるか?
  • RQ5FaceNet や SphereFace といった最先端の深層顔表現の容量は、誤認証率の制限が厳しくなるにつれてどのように変化するか?

主な発見

  • 1%の誤認証率(FAR)において、FaceNetの推定容量上限はIJB-Cデータセットで2.7 × 10⁴人である。
  • SphereFaceは同じFARで8.4 × 10⁴人の顔認識を可能とするという顕著に高い容量推定値を示し、非制約的条件下での優れた識別性能を示している。
  • 0.1%のFARに厳しくすると、FaceNetの容量は2.2 × 10³人に低下し、SphereFaceの容量も3.6 × 10³人に減少する。
  • 0.001%のFARでは、FaceNetの容量は1.6 × 10¹人にまで低下し、SphereFaceの容量は6.0 × 10⁰人にまで低下する。これは急激なスケーラビリティの限界を示している。
  • 非対称な超楕円体(一般形状)の容量推定値は、等方的または軸に平行な超楕円体の推定値よりも2桁以上高い。形状の非対称性をモデル化することが重要であることが示された。
  • 理論的容量と実際の性能の間には顕著なギャップが存在し、現在の顔認識表現モデルの改善余地が広く残っていることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。