Skip to main content
QUICK REVIEW

[논문 리뷰] Pathological spectra of the Fisher information metric and its variants in deep neural networks

Ryo Karakida, Shotaro Akaho|arXiv (Cornell University)|2019. 10. 14.
Statistical Mechanics and Entropy참고 문헌 45인용 수 10
한 줄 요약

이 논문은 넓은 크기의 무작위로 초기화된 딥 네ural 네트워크에서 피셔 정보 메트릭(FIM) 및 그 변종이 병리적인 고유값 스펙트럼을 보임을 밝혀낸다: 몇몇 고유값이 극단적인 이방성(outlier)이 되는 반면 대부분은 작게 유지되며, 이는 매개변수 공간에서 매우 비대칭적인 곡률을 나타낸다. 저자들은 평균장 이론과 랜덤 매트릭스 이론을 사용하여 이러한 스펙트럼에 대한 해석적 표현을 유도하며, 이 현상이 회귀, 소프트맥스를 사용한 분류, 신경접선 커널, 특징공간 메트릭 등 FIM 전반에 걸쳐 지속됨을 보여준다.

ABSTRACT

The Fisher information matrix (FIM) plays an essential role in statistics and machine learning as a Riemannian metric tensor or a component of the Hessian matrix of loss functions. Focusing on the FIM and its variants in deep neural networks (DNNs), we reveal their characteristic scale dependence on the network width, depth and sample size when the network has random weights and is sufficiently wide. This study covers two widely-used FIMs for regression with linear output and for classification with softmax output. Both FIMs asymptotically show pathological eigenvalue spectra in the sense that a small number of eigenvalues become large outliers depending the width or sample size while the others are much smaller. It implies that the local shape of the parameter space or loss landscape is very sharp in a few specific directions while almost flat in the other directions. In particular, the softmax output disperses the outliers and makes a tail of the eigenvalue density spread from the bulk. We also show that pathological spectra appear in other variants of FIMs: one is the neural tangent kernel; another is a metric for the input signal and feature space that arises from feedforward signal propagation. Thus, we provide a unified perspective on the FIM and its variants that will lead to more quantitative understanding of learning in large-scale DNNs.

연구 동기 및 목표

  • 무작위 가중치를 가진 딥 네럴 네트워크에서 피셔 정보 메트릭(FIM) 및 그 변종의 스펙트럼적 성질을 이론적으로 분석하는 것.
  • 네트워크의 넓이, 깊이, 샘플 크기가 회귀 및 분류 설정에서 FIM의 고유값 분포에 미치는 영향를 이해하는 것.
  • 기존의 평균제곱오차 손실에 대한 FIM 연구를 확장하여, 분류 작업에서 일반적인 설정인 교차엔트로피 손실과 소프트맥스 출력을 포함하는 것.
  • 신경접선 커널 및 특징공간 메트릭을 포함한 다양한 FIM 변종 간의 병리적 스펙트럼을 통합적으로 이해하는 것.
  • 평균장 이론과 랜덤 매트릭스 이론을 사용하여 넓은 DNN에서 고유값 통계를 해석적으로 예측할 수 있는 이론적 프레임워크를 제공하는 것.

제안 방법

  • 저자들은 넓고 무작위로 초기화된 DNN에서 경사와 활성화 통계를 기술하는 순서 매개변수를 유도하기 위해 평균장 이론을 사용한다.
  • 네트워크의 넓이가 무한대에 접근함에 따라 FIM 및 그 변종의 渐近적 고유값 분포를 분석하기 위해 랜덤 매트릭스 이론을 적용한다.
  • FIM은 각 층에 대응하는 블록 행렬로 분해되며, 이중 행렬 표현을 사용하여 고유값 통계를 유도한다.
  • 소프트맥스 출력 케이스의 경우, FIM은 기울기의 외적 곱의 합으로 표현되며, 섭동 분석을 통해 주요 고유값 행동을 유도한다.
  • 신경접선 커널(NTK)과 특징공간 메트릭은 동일한 프레임워크를 사용하여 분석되며, 동일한 병리적 스펙트럼 행동을 보임을 보여준다.
  • FIM의 평균, 두 번째 모멘트, 최대 고유값에 대한 해석적 표현을 활성화 통계와 가중치 분산 매개변수의 형태로 유도한다.

실험 결과

연구 질문

  • RQ1회귀 작업에 대해 넓은 크기의 무작위로 초기화된 딥 네럴 네트워크에서 FIM의 고유값 스펙트럼은 어떻게 행동하는가?
  • RQ2소프트맥스 출력과 교차엔트로피 손실을 사용한 분류 네트워크에서도, 몇몇 큰 고유값과 다수의 작은 고유값으로 구성된 병리적 스펙트럼 행동이 유지되는가?
  • RQ3네트워크의 깊이, 넓이, 학습 샘플 크기가 FIM 및 그 변종에서 극단적 고유값의 발생에 얼마나 영향을 미치는가?
  • RQ4신경접선 커널과 특징공간 메트릭과 같은 유사한 메트릭에서도 동일한 병리적 스펙트럼 패턴이 나타나는가?
  • RQ5평균장 이론과 랜덤 매트릭스 이론을 사용하여 다양한 FIM 변종 간의 스펙트럼 병리 현상을 통합적으로 설명할 수 있는 이론적 프레임워크가 존재하는가?

주요 결과

  • 소프트맥스 출력을 사용한 분류에 대한 FIM은 병리적인 고유값 스펙트럼을 보이며, 하나의 주요 고유값이 네트워크의 넓이에 따라 증가하는 반면, 나머지 고유값들은 작게 유지되어 매개변수 공간 곡률의 극도로 비대칭함을 나타낸다.
  • 최대 고유값은 $ \lambda_{\text{max}} \sim \tilde{\alpha} \left( \frac{N-1}{N} \tilde{\kappa}_2 + \frac{1}{N} \tilde{\kappa}_1 \right) $ 로 스케일링되며, 여기서 $ \tilde{\alpha} $ 는 넓이와 활성화 통계에 의존한다.
  • 회귀(최소제곱오차 손실)에 대한 FIM의 고유값 스펙트럼 역시 병리적 행동을 보이며, 네트워크의 넓이가 증가함에 따라 渐진적으로 하나의 이방성 고유값이 나타난다.
  • 신경접선 커널(NTK)과 신호 전파로부터 유도된 특징공간 메트릭 역시 동일한 병리적 스펙트럼 패턴을 보이며, 이는 보편적인 현상임을 시사한다.
  • 최대 고유값에 대응하는 고유벡터는 기대 기울기 $ \mathbb{E}[\nabla_h f_k] $ 와 정렬되어 있으며, 이는 날카운 방향이 전역 매개변수 이동과 대응함을 나타낸다.
  • 다수의 고유값은 0 근처에 집중되어 있는 반면, 이방성 고유값이 스펙트럼을 지배하므로 최적화는 좁고 비틀린 부분공간에 제한됨을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.