Skip to main content
QUICK REVIEW

[論文レビュー] Single Unit Status in Deep Convolutional Neural Network Codes for Face Identification: Sparseness Redefined

Connor J. Parde, Yvette Colón|arXiv (Cornell University)|Feb 14, 2020
Face recognition and analysis参考文献 35被引用数 9
ひとこと要約

この論文は、深層畳み込みニューラルネットワーク(DCNN)が、個々のニューロンレベルおよびアンサンブルレベルで顔のアイデンティティ、性別、視点をどのように符号化するかを調査する。体系的なユニットのプルーニングにより、アイデンティティ認識は、たとえ2ユニットのみでも依然として頑健に保たれること(AUC ≈ 1.0)が示され、疎で重複のない分散符号化が存在することが明らかになった。一方、性別および視点分類はより急激に劣化するため、同じ高次元空間内でも、異なる属性は異なる符号化戦略によって符号化されていることが示唆される。

ABSTRACT

Deep convolutional neural networks (DCNNs) trained for face identification develop representations that generalize over variable images, while retaining subject (e.g., gender) and image (e.g., viewpoint) information. Identity, gender, and viewpoint codes were studied at the "neural unit" and ensemble levels of a face-identification network. At the unit level, identification, gender classification, and viewpoint estimation were measured by deleting units to create variably-sized, randomly-sampled subspaces at the top network layer. Identification of 3,531 identities remained high (area under the ROC approximately 1.0) as dimensionality decreased from 512 units to 16 (0.95), 4 (0.80), and 2 (0.72) units. Individual identities separated statistically on every top-layer unit. Cross-unit responses were minimally correlated, indicating that units code non-redundant identity cues. This "distributed" code requires only a sparse, random sample of units to identify faces accurately. Gender classification declined gradually and viewpoint estimation fell steeply as dimensionality decreased. Individual units were weakly predictive of gender and viewpoint, but ensembles proved effective predictors. Therefore, distributed and sparse codes co-exist in the network units to represent different face attributes. At the ensemble level, principal component analysis of face representations showed that identity, gender, and viewpoint information separated into high-dimensional subspaces, ordered by explained variance. Identity, gender, and viewpoint information contributed to all individual unit responses, undercutting a neural tuning analogy for face attributes. Interpretation of neural-like codes from DCNNs, and by analogy, high-level visual codes, cannot be inferred from single unit responses. Instead, "meaning" is encoded by directions in the high-dimensional space.

研究の動機と目的

  • 深層畳み込みニューラルネットワーク(DCNN)が、個々のニューロンレベルおよびアンサンブルレベルで、顔のアイデンティティ、性別、視点をどのように表現するかを理解すること。
  • DCNNのトップレイヤー内の個々のニューロンユニットが、単独で特定の顔属性を符号化しているのか、あるいは集合的にのみ符号化しているのかをテストすること。
  • トップレイヤーのユニットの疎でランダムな部分集合が、高い顔識別精度を維持できるかどうかを特定すること。
  • 個々のユニットが複数の属性にどの程度寄与しているかを調査し、特徴固有のチューニングという概念に疑問を呈すること。
  • DCNNにおけるニューラルコードの「意味」が、単一ユニット応答から推定可能かどうか、あるいは集団レベルの分析を要するかを評価すること。

提案手法

  • 58,000人のアイデンティティを含む570万枚の画像からなるUniverseデータセットを用いて、α = 50のCrystal Loss(L2 Softmax)を用いてResNet-101 DCNNを訓練した。
  • アイデンティティ、性別、視点の分析のため、ペンルティメートレイヤー(512ユニットの表現)をトップレイヤーの顔記述子として抽出した。
  • IJB-Cの保証付きテストセット(22,248枚の顔)を用いて、AUCを用いてアイデンティティ性能を評価した。各グループあたり5,562枚の画像をランダムに分割した。
  • 性別分類の評価には、100分割交差検証を用いた線形判別分析(LDA)を実施し、各フォールドで300人のアイデンティティをホールドアウトした。
  • 視点予測には、正面姿勢からのヨー角偏差を正例として、モールス・ペンローズの疑似逆行列を用いた線形回帰を実行した。
  • 性別および視点予測の統計的有意性を評価するために、パーミュテーションテスト(n=1,000)を実施し、すべての結果でp < 0.001とした。
  • 各512ユニットおよび512主成分(PC)に対して、アイデンティティ、性別、視点を従属変数とし、顔画像をランダム要因として用いて分散分析(ANOVA)を実施した。

実験結果

リサーチクエスチョン

  • RQ1訓練済みDCNNのトップレイヤーから、疎でランダムなユニット部分集合のみを用いても、顔のアイデンティティを正確に識別できるか?
  • RQ2個々のニューロンユニットは、DCNNにおいてアイデンティティ、性別、視点の表現にどのように寄与しているか?
  • RQ3顔属性に関する情報がユニット全体にどのように分散しているか、また、アンサンブル活動に依存しているか?
  • RQ4単一ユニット応答のみで、性別や視点といったカテゴリカルな顔属性の符号化を説明できるか?
  • RQ5トップレイヤー表現の主成分は、アイデンティティ、性別、視点情報の分離にどのように関連しているか?

主な発見

  • アイデンティティ識別性能は、トップレイヤーの512ユニットからたった2ユニットのみを用いても極めて高く維持された(AUC ≈ 1.0)ことから、極度の疎な状態でも頑健であることが示された。
  • すべてのトップレイヤーのユニットにおいて、個々のアイデンティティが統計的に分離可能であったため、各ユニットが固有のアイデンティティ情報に寄与していることが示された。
  • ユニット間応答の相関は最小限に抑えられており、ユニットが重複のない独立したアイデンティティの手がかりを符号化していることが示された。
  • 性別分類性能はユニットプルーニングに伴い徐々に低下したため、性別はより広範な分散型のユニット集団によって符号化されていると考えられる。
  • 視点推定性能はユニット削減に伴い急激に低下したため、視点はより感受性が高く、アンサンブル依存的な符号化によって表現されていると考えられる。
  • 分散分析(ANOVA)の結果、アイデンティティ、性別、視点情報がすべての個々のユニット応答に寄与しており、顔属性に対する神経チューニングのアナロジーを厳密に支持しないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。