Skip to main content
QUICK REVIEW

[논문 리뷰] A Gaussian Process perspective on Convolutional Neural Networks

Anastasia Borovykh|arXiv (Cornell University)|2018. 10. 25.
Gaussian Processes and Bayesian Inference참고 문헌 24인용 수 16
한 줄 요약

이 논문은 컨volution 레이어에서 i.i.d.가 아닌 입력으로도 적용 가능한 중심극한정리의 일반화를 통해 컨volution 신경망(CNN)에 대한 가우시안 프로세스(GP) 관점을 수립한다. 이는 입력이 종속적이고 동일분포가 아니어도 CNN 출력이 여전히 GP 사전분포로 수렴함을 보여주며, 특히 tanh와 같은 유계 활성화 함수를 사용할 경우 CNN이 GP처럼 행동함을 실험적으로 확인한다. 이는 GP 추론을 통한 분석적 불확실성 측정 가능성을 제공한다.

ABSTRACT

In this paper we cast the well-known convolutional neural network in a Gaussian process perspective. In this way we hope to gain additional insights into the performance of convolutional networks, in particular understand under what circumstances they tend to perform well and what assumptions are implicitly made in the network. While for fully-connected networks the properties of convergence to Gaussian processes have been studied extensively, little is known about situations in which the output from a convolutional network approaches a multivariate normal distribution.

연구 동기 및 목표

  • CNN의 이론적 이해를 확장하기 위해, 특히 GP 사전분포로의 수렴을 가우시안 프로세스(GP)의 관점에서 프레임워크화하는 것.
  • 완전연결 네트워크와는 달리 CNN에서 GP 수렴에 대한 이론적 분석이 부족한 점을 보완하는 것.
  • 입력이 종속적이거나 동일분포가 아닐 경우에도 CNN 출력이 다변량 정규분포로 수렴하는 조건을 규명하는 것.
  • 활동 함수와 네트워크 깊이가 이 수렴에 미치는 영향을 평가하기 위해 CNN과 GP 사전분포 간의 차이를 수치적으로 평가하는 것.
  • GP 유사 행동이 CNN의 사후 불확실성 추정에 미치는 영향을 탐색하여, MCMC나 앙상블 없이도 분석적 추론이 가능하도록 하는 것.

제안 방법

  • 컨볼루션 레이어에서 비i.i.i.d. 가중합을 다룰 수 있도록 일반화된 중심극한정리(Lyapunov 유형의 경계)를 적용하여, i.i.i.d. 입력을 넘어서는 GP 수렴 프레임워크를 확장하는 것.
  • CNN 출력에 대해 재귀적 커널 표현식을 유도하여, GP 공분산 함수의 구조를 그대로 반영함으로써 GP 사전분포와 직접 비교할 수 있도록 하는 것.
  • 다양한 활성화 함수와 입력 유형에서 CNN 출력 분포와 해당 GP 사전분포 간의 거리를 수치적으로 측정하기 위해 최대 평균 차이(MMD)를 사용하는 것.
  • 실제 데이터 의존성 구조를 반영하기 위해 i.i.i.d. 입력과 자기회귀 시계열 입력을 모두 테스트하여 GP 근사의 강건성을 평가하는 것.
  • 데이터셋에 대해 훈련한 후 CNN의 사후 평균과 분산을 해당 GP의 사후와 비교하기 위해 앙상블 추론(N=100)을 사용하여 사후 불확실성 추정을 근사하는 것.
  • 선형, ReLU, 하이퍼볼릭 tangent 활성화 함수를 사용하여 이들이 GP 수렴과 사후 일치도에 미치는 영향을 평가하는 것.

실험 결과

연구 질문

  • RQ1입력이 i.i.i.d.가 아닐 경우, 어떤 조건에서 컨volution 신경망의 출력이 가우시안 프로세스 사전분포로 수렴하는가?
  • RQ2활동 함수의 선택(예: ReLU 대비 tanh)이 CNN 출력과 GP 사전분포 간의 차이에 어떤 영향을 미치는가?
  • RQ3입력 종속성(예: 자기회귀 구조)은 CNN의 GP 근사에 어떤 정도의 영향을 미치는가?
  • RQ4CNN의 GP 사전분포를 사용하여 불확실성을 분석적으로 추정할 수 있으며, CNN 사후분포는 GP 사후분포와 얼마나 유사한가?
  • RQ5CNN 출력이 GP로 수렴하는 속도는 어떠한가, 그리고 깊은 레이어에서 종속 변수에 대해 이 수렴을 엄밀히 증명할 수 있는가?

주요 결과

  • 비i.i.i.d. 입력이 존재하더라도 첫 번째 레이어에서 Lyapunov 유형의 경계를 통해 CNN 출력 분포가 가우시안 프로세스 사전분포로 수렴함을 입증함으로써, i.i.i.d. 설정을 넘어서는 GP 수렴을 일반화함.
  • ReLU 활성화 함수를 사용할 경우, 깊이가 증가할수록 CNN과 GP 사전분포 간의 차이가 크게 증가하며, 특히 i.i.i.d. 입력에서 GP 행동에서의 이탈이 두드러짐.
  • 유계 활성화 함수인 하이퍼볼릭 탄젠트의 경우, 여러 레이어에 걸쳐 차이가 작게 유지되어 비선형성과 유계 변환 하에서도 강한 GP 유사 행동을 보임.
  • 입력이 AR(2) 과정을 따를 경우, 비유계 활성화 함수(선형 및 ReLU)를 사용할 경우 GP 근사 오차가 유계 활성화 함수(tanh)보다 크게 증가함. 이는 가중합에서의 의존성 증가 때문임.
  • 100개의 랜덤 초기화를 사용한 앙상블 추론을 통해 훈련된 CNN의 사후 평균과 분산 추정치가 해당 GP 사후와 강력한 일치를 보이며, CNN에 대해 GP 기반 불확실성 측정이 가능함을 시사함.
  • 실험 결과는 유계 활성화 함수를 사용하고 필터 크기가 중간 수준(2–8)이며 깊이가 보통 수준(2–5 레이어)인 CNN가 GP 유사 행동을 보임을 시사하며, 이는 CNN의 분석적 불확실성 측정에 GP를 활용할 수 있음을 뒷받침함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.