[논문 리뷰] Infinitely Wide Tensor Networks as Gaussian Process
이 논문은 순수한 행렬 곱 상태(MPS)와 두 가지 하이브리드 아키텍처(신경 커널 MPS 및 은닉 신경층을 가진 MPS)를 포함한 무한한 폭을 가진 텐서 네트워크가 무한한 폭 근처에서 가우시안 프로세스(GP)로 수렴함을 규명한다. 유도된 GP의 평균 및 공분산 함수를 도출함으로써, 저자들은 사전 분포의 표준편차와 같은 초매개변수가 GP의 특성 길이 척도를 제어함을 보여주며, 수치 실험을 통해 사전 분산이 증가할수록 더 복잡한 표본 경로가 유도됨을 확인한다.
Gaussian Process is a non-parametric prior which can be understood as a distribution on the function space intuitively. It is known that by introducing appropriate prior to the weights of the neural networks, Gaussian Process can be obtained by taking the infinite-width limit of the Bayesian neural networks from a Bayesian perspective. In this paper, we explore the infinitely wide Tensor Networks and show the equivalence of the infinitely wide Tensor Networks and the Gaussian Process. We study the pure Tensor Network and another two extended Tensor Network structures: Neural Kernel Tensor Network and Tensor Network hidden layer Neural Network and prove that each one will converge to the Gaussian Process as the width of each model goes to infinity. (We note here that Gaussian Process can also be obtained by taking the infinite limit of at least one of the bond dimensions $α_{i}$ in the product of tensor nodes, and the proofs can be done with the same ideas in the proofs of the infinite-width cases.) We calculate the mean function (mean vector) and the covariance function (covariance matrix) of the finite dimensional distribution of the induced Gaussian Process by the infinite-width tensor network with a general set-up. We study the properties of the covariance function and derive the approximation of the covariance function when the integral in the expectation operator is intractable. In the numerical experiments, we implement the Gaussian Process corresponding to the infinite limit tensor networks and plot the sample paths of these models. We study the hyperparameters and plot the sample path families in the induced Gaussian Process by varying the standard deviations of the prior distributions. As expected, the parameters in the prior distribution namely the hyper-parameters in the induced Gaussian Process controls the characteristic lengthscales of the Gaussian Process.
연구 동기 및 목표
- 텐서 네트워크의 폭이 무한히 증가할 때의 기능적 극한을 조사하기 위해.
- 무한한 폭을 가진 텐서 네트워크와 가우시안 프로세스(GP) 간의 등가성을 확립하기 위해.
- 일반적인 설정에서 유도된 GP의 평균 및 공분산 함수를 분석하기 위해.
- 사전 분포의 초매개변수가 유도된 GP의 특성 길이 척도에 어떻게 영향을 미치는지 탐구하기 위해.
- 다양한 사전 분산 하에서 표본 경로 가족에 대한 수치 실험을 통해 이론적 결과를 검증하기 위해.
제안 방법
- 순수한 행렬 곱 상태(MPS)의 무한한 폭 근처에서의 수렴을 도출하고, 잘 정의된 평균 및 공분산 함수를 가진 GP로 수렴함을 보여주기 위해.
- 신경 커널 MPS 및 은닉 신경층을 가진 MPS와 같은 두 가지 하이브리드 아키텍처로 분석을 확장하여, 그들이 무한한 폭 근처에서 GP로 수렴함을 증명하기 위해.
- 기대값 연산자를 사용하여 유도된 GP의 유한차원 분포의 평균 벡터 및 공분산 행렬을 계산하기 위해.
- 기대값 적분이 해석이 불가능할 경우 이를 분석적 근사로 처리하기 위해.
- 무한한 폭 텐서 네트워크에서 유도된 GP를 수치적으로 구현하고, 시각화를 위한 표본 경로를 생성하기 위해.
- 사전 분포의 표준편차를 체계적으로 변화시켜 표본 경로의 복잡성과 길이 척도에 미치는 영향을 연구하기 위해.
실험 결과
연구 질문
- RQ1순수한 행렬 곱 상태(MPS) 텐서 네트워크의 무한한 폭 근처에서 수렴이 가우시안 프로세스로 이루어지는가?
- RQ2신경 커널 MPS 및 은닉 신경층을 가진 MPS와 같은 하이브리드 텐서 네트워크 아키텍처가 무한한 폭 근처에서 어떻게 행동하는가?
- RQ3무한한 폭을 가진 텐서 네트워크에서 유도된 GP의 평균 및 공분산 함수의 명시적 형태는 무엇인가?
- RQ4사전 분포의 표준편차와 같은 초매개변수가 결과 GP의 특성 길이 척도에 어떻게 영향을 미치는가?
- RQ5수치 실험을 통해 사전 분산을 증가시키면 유도된 GP에서 더 복잡하고 더 유연한 표본 경로가 생성되는가를 확인할 수 있는가?
주요 결과
- 순수한 행렬 곱 상태(MPS)의 무한한 폭 근처에서 수렴은 가우시안 프로세스로 수렴하지만, 비선형성이 없기 때문에 불확실성 밴드가 0인 비트리비얼한 GP가 된다.
- 신경 커널 MPS 및 은닉 신경층을 가진 MPS는 모두 폭이 무한해질수록 가우시안 프로세스로 수렴하며, 순수 선형 모델을 초월해 GP 등가성의 적용 범위를 확장한다.
- 일반적인 설정에서 유도된 GP의 평균 함수 및 공분산 함수는 명시적으로 도출되었으며, 이는 극한 과정의 폐쇄형 특성화를 제공한다.
- 기대값 적분이 해석이 불가능할 경우 공분산 함수는 분석적 근사를 통해 근사되었으며, 이는 GP 커널의 실용적 계산을 가능하게 한다.
- 수치 실험을 통해 사전 분포의 표준편차를 증가시키면 더 복잡하고 변동성이 큰 표본 경로가 생성됨을 확인하였으며, 이는 GP의 특성 길이 척도를 직접 제어함을 보여준다.
- 무한한 폭 텐서 네트워크 모델에서 유도된 표본 경로 가족은 사전 분산과 같은 초매개변수가 함수 공간의 복잡성과 매끄러움을 지배함을 보여주며, GP 성질에 대한 이론적 제어가 검증됨을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.