Skip to main content
QUICK REVIEW

[논문 리뷰] Single Unit Status in Deep Convolutional Neural Network Codes for Face Identification: Sparseness Redefined

Connor J. Parde, Yvette Colón|arXiv (Cornell University)|2020. 02. 14.
Face recognition and analysis참고 문헌 35인용 수 9
한 줄 요약

이 논문은 딥 컨volution 신경망(DCNNs)이 단일 유닛 및 집단 수준에서 얼굴 정체성, 성별, 시점 정보를 어떻게 인코딩하는지 조사한다. 체계적인 유닛 제거를 통해 정체성 인식은 단 2개의 유닛으로도 매우 강건하게 유지됨(AUC ≈ 1.0)을 보이며, 희박하고 중복되지 않는 분산 코드를 형성함을 시사한다. 반면 성별 및 시점 분류 성능는 더 급격히 떨어지며, 동일한 고차원 공간 내에서 서로 다른 인코딩 전략이 사용됨을 나타낸다.

ABSTRACT

Deep convolutional neural networks (DCNNs) trained for face identification develop representations that generalize over variable images, while retaining subject (e.g., gender) and image (e.g., viewpoint) information. Identity, gender, and viewpoint codes were studied at the "neural unit" and ensemble levels of a face-identification network. At the unit level, identification, gender classification, and viewpoint estimation were measured by deleting units to create variably-sized, randomly-sampled subspaces at the top network layer. Identification of 3,531 identities remained high (area under the ROC approximately 1.0) as dimensionality decreased from 512 units to 16 (0.95), 4 (0.80), and 2 (0.72) units. Individual identities separated statistically on every top-layer unit. Cross-unit responses were minimally correlated, indicating that units code non-redundant identity cues. This "distributed" code requires only a sparse, random sample of units to identify faces accurately. Gender classification declined gradually and viewpoint estimation fell steeply as dimensionality decreased. Individual units were weakly predictive of gender and viewpoint, but ensembles proved effective predictors. Therefore, distributed and sparse codes co-exist in the network units to represent different face attributes. At the ensemble level, principal component analysis of face representations showed that identity, gender, and viewpoint information separated into high-dimensional subspaces, ordered by explained variance. Identity, gender, and viewpoint information contributed to all individual unit responses, undercutting a neural tuning analogy for face attributes. Interpretation of neural-like codes from DCNNs, and by analogy, high-level visual codes, cannot be inferred from single unit responses. Instead, "meaning" is encoded by directions in the high-dimensional space.

연구 동기 및 목표

  • 딥 컨volution 신경망(DCNNs)이 단일 유닛 및 집단 수준에서 얼굴 정체성, 성별, 시점 정보를 어떻게 표현하는지 이해하는 것.
  • DCNN의 최상위 레이어 내 개별 신경 유닛이 고립적으로 특정 얼굴 특성에 대해 코드화되는지, 아니면 공동으로만 작용하는지 테스트하는 것.
  • 최상위 레이어 유닛의 희박하고 무작위로 선택된 부분집합이 높은 얼굴 식별 정확도를 유지할 수 있는지 확인하는 것.
  • 개별 유닛이 다수의 특성에 기여하는 정도를 조사하여, 특성에 특화된 조정 이론을 도전하는 것.
  • DCNN 내 신경 코드의 '의미'가 단일 유닛 반응으로부터 유추될 수 있는지, 아니면 집단 수준의 분석이 필요하는지 평가하는 것.

제안 방법

  • 58,000명의 정체성과 570만 장의 이미지를 포함하는 Universe 데이터셋을 사용하여 ResNet-101 DCNN를 훈련시켰으며, α = 50인 Crystal Loss(L2 Softmax)를 사용하였다.
  • 정체성, 성별, 시점 분석을 위한 최상위 레이어 얼굴 기술자로 512유닛 표현인 제일 뒤에서 두 번째 레이어를 추출하였다.
  • IJB-C의 22,248장의 얼굴 이미지로 구성된 검증 세트에서 AUC를 사용하여 정체성 성능을 평가하였으며, 그룹당 5,562장의 이미지를 무작위로 분할하였다.
  • 성별 분류 성능 평가를 위해 100개의 폴드로 교차검증을 실시한 선형 판별 분석(LDA)을 사용하였으며, 각 폴드에서 300명의 정체성을 제외하였다.
  • 시점 예측을 위해 모어-펜로즈 역행렬을 사용한 선형 회귀를 실시하였으며, 정면 시점에서의 야각 편차를 진짜값으로 사용하였다.
  • 성별 및 시점 예측의 통계적 유의성을 평가하기 위해 순열 검정(n=1,000)을 실시하였으며, 모든 결과에서 p < 0.001을 기준으로 하였다.
  • 각 512개의 유닛과 512개의 주성분(PCA)에 대해 ANOVA 분석을 실시하였으며, 종속 변수로 정체성, 성별, 시점을 사용하고 얼굴 이미지를 무작위 요인으로 하였다.

실험 결과

연구 질문

  • RQ1훈련된 DCNN의 최상위 레이어에서 희박하고 무작위로 선택된 유닛 부분집합만으로도 얼굴 정체성을 정확하게 인식할 수 있는가?
  • RQ2개별 신경 유닛이 DCNN 내에서 정체성, 성별, 시점 표현에 어떻게 기여하는가?
  • RQ3얼굴 특성 정보가 유닛 간에 얼마나 분산되어 있으며, 집단 활동에 의존하는가?
  • RQ4단일 유닛 반응만으로도 성별이나 시점과 같은 범주형 얼굴 특성의 인코딩을 설명할 수 있는가?
  • RQ5최상위 레이어 표현의 주성분은 정체성, 성별, 시점 정보의 분리와 어떻게 관련되는가?

주요 결과

  • 최상위 레이어의 512개 유닛 중 단 2개만 사용할 경우에도 얼굴 식별 성능가 매우 높게 유지됨(AUC ≈ 1.0)을 보이며, 극도로 희박한 상황에서도 강건함을 시사한다.
  • 모든 최상위 레이어 유닛에서 개별 정체성이 통계적으로 분리 가능함을 보이며, 각 유닛이 고유한 정체성 정보를 기여함을 입증한다.
  • 유닛 간 반응 상관관계가 최소한이어서, 유닛들이 중복되지 않고 독립적인 정체성 신호를 인코딩함을 나타낸다.
  • 유닛 제거에 따라 성별 분류 성능가 점진적으로 저하됨을 보이며, 성별 정보가 더 넓은 분산된 유닛 집단에 의해 인코딩됨을 시사한다.
  • 유닛 수 감소에 따라 시점 추정 성능가 급격히 떨어지며, 이는 시점 정보가 더 민감하고 집단 의존적인 방식으로 인코딩됨을 나타낸다.
  • ANOVA 결과, 정체성, 성별, 시점 정보가 모든 개별 유닛 반응에 기여함을 보이며, 얼굴 특성에 대한 엄밀한 신경 조정 이론을 도전한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.