[논문 리뷰] Fisher Information and Natural Gradient Learning of Random Deep Networks
이 논문은 평균장 근사 하에서 피셔 정보 행렬의 정확한 역행렬을 유도하여 무작위 딥 신경망에서 자연 경사하강법을 명시적 분석 방법으로 계산하는 방법을 제안한다. 피셔 행렬이 약간의 단위 블록 대각 행렬임을 증명함으로써, 수치적 행렬 역행렬 계산 없이도 효율적인 자연 경사하강법 학습이 가능하며, 특히 ReLU 활성화를 갖는 잔차망에서 효과적이다.
A deep neural network is a hierarchical nonlinear model transforming input signals to output signals. Its input-output relation is considered to be stochastic, being described for a given input by a parameterized conditional probability distribution of outputs. The space of parameters consisting of weights and biases is a Riemannian manifold, where the metric is defined by the Fisher information matrix. The natural gradient method uses the steepest descent direction in a Riemannian manifold, so it is effective in learning, avoiding plateaus. It requires inversion of the Fisher information matrix, however, which is practically impossible when the matrix has a huge number of dimensions. Many methods for approximating the natural gradient have therefore been introduced. The present paper uses statistical neurodynamical method to reveal the properties of the Fisher information matrix in a net of random connections under the mean field approximation. We prove that the Fisher information matrix is unit-wise block diagonal supplemented by small order terms of off-block-diagonal elements, which provides a justification for the quasi-diagonal natural gradient method by Y. Ollivier. A unitwise block-diagonal Fisher metrix reduces to the tensor product of the Fisher information matrices of single units. We further prove that the Fisher information matrix of a single unit has a simple reduced form, a sum of a diagonal matrix and a rank 2 matrix of weight-bias correlations. We obtain the inverse of Fisher information explicitly. We then have an explicit form of the natural gradient, without relying on the numerical matrix inversion, which drastically speeds up stochastic gradient learning.
연구 동기 및 목표
- 딥 네트워크에서 전체 피셔 정보 행렬의 역행렬 계산이 계산적으로 불가능한 문제를 해결하기 위해.
- 이전 자연 경사하강법에서 사용된 피셔 행렬의 준대각 근사법을 정당화하기 위해.
- 가우시안 입력 가정 하에 단위별 피셔 정보 행렬의 명시적, 닫힌 형태의 역행렬을 유도하기 위해.
- 블록 대각 행렬 구조를 활용하여 수치적 행렬 역행렬 계산 없이도 효율적인 자연 경사하강법 학습을 가능하게 하기 위해.
- 잔차망에 대해 평균장 분석을 사용하여 ReLU 활성화를 갖는 네트워크로 이 방법을 확장하기 위해.
제안 방법
- i.i.d. 가우시안 가중치와 편향을 갖는 무작위 딥 네트워크에서 피셔 정보 행렬을 분석하기 위해 통계적 뉴로다이내믹스 방법과 평균장 근사를 사용한다.
- 피셔 행렬이 약간의 단위 블록 대각 행렬임을 증명하며, 비대각 항목의 크기가 레이어당 뉴런 수 $n$에 대해 $1/\sqrt{n}$의 주기임을 보인다.
- 단일 뉴런에 대한 피셔 정보 행렬의 정확한 형태를 구하며, 이는 대각 행렬과 가중치-편향 상관관계를 캡처하는 랭크-2 행렬의 합으로 표현된다.
- 단위별 피셔 정보 행렬의 역행렬을 명시적으로 계산하여 수치적 역행렬 계산을 피하고, 자연 경사하강법 업데이트를 빠르게 수행할 수 있도록 한다.
- 유도된 역행렬을 활용하여 ReLU 활성화를 갖는 잔차망을 위한 계산적으로 효율적인 자연 경사하강법 학습 알고리즘을 설계한다.
- 각 레이어의 입력이 잔차 연결에서의 무작위 선형 변환으로 인해 약간의 i.i.d. 표준 가우시안 분포를 따르므로, 이 가정 하에 방법을 검증한다.
실험 결과
연구 질문
- RQ1무작위 딥 네트워크에서 피셔 정보 행렬을 어떻게 근사할 수 있으며, 이는 효율적인 자연 경사하강법 학습을 가능하게 하는가?
- RQ2가우시안 입력 가정 하에 단일 뉴런의 피셔 정보 행렬의 구조적 형태는 무엇인가?
- RQ3대규모 무작위 네트워크에서 단위별 블록 대각 근사법이 성립하는가? 그리고 그 이유는 무엇인가?
- RQ4수치적 역행렬 계산 없이도 단위별 피셔 정보 행렬의 역행렬을 명시적으로 계산할 수 있는가?
- RQ5평균장 근사는 잔차망에서 준대각 자연 경사하강법 방법의 효과성을 어떻게 정당화하는가?
주요 결과
- 대규모 무작위 딥 네트워크에서 피셔 정보 행렬은 약간의 단위 블록 대각 행렬이며, 비대각 항목의 크기가 $1/\sqrt{n}$의 주기로 나타나, 준대각 근사법의 타당성을 뒷받침한다.
- 가우시안 입력 조건 하에서 단일 뉴런의 피셔 정보 행렬은 대각 행렬과 랭크-2 행렬의 합으로 줄어든다. 이 랭크-2 행렬은 가중치-편향 상관관계를 나타낸다.
- 단위별 피셔 정보 행렬의 역행렬이 닫힌 형태로 명시적으로 계산되었으며, 이는 행렬 역행렬 계산 없이 자연 경사하강법을 직접 계산할 수 있음을 의미한다.
- 이 방법은 특히 랜덤 선형 변환으로 인해 각 레이어의 입력이 약간의 i.i.d. 표준 가우시안 분포를 따르는 ReLU 활성화를 갖는 잔차망에서 매우 효과적이다.
- 유도된 자연 경사하강법 업데이트 규칙은 계산적으로 효율적이며, 전체 피셔 정보 행렬의 역행렬 계산에 따른 높은 비용을 피할 수 있다.
- 이론적 프레임워크는 TANGO와 같은 적응형 자연 경사하강법 방법에서 속도 벡터를 초기화하는 데 기초를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.