Skip to main content
QUICK REVIEW

[논문 리뷰] Fast Neural Kernel Embeddings for General Activations

In‐Su Han, Amir Zandieh|arXiv (Cornell University)|2022. 09. 09.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 일반적인 매끄러운 활성화 함수를 위한 신경망 가우시안 프로세스(NNGP) 및 신경 탄성 커널(NTK) 행렬을 구하는 데 빠르고 일반적인 방법을 제안한다. 유한한 에르미트 전개를 사용하고 스케칭 기법을 적용함으로써, 정확한 계산 대비 최대 106배의 속도 향상을 달성하면서도 높은 정확도를 유지한다. 이는 ReLU를 초과하는 다양한 아키텍처와 데이터셋에서 스케일러블한 커널 기반 분석을 가능하게 한다.

ABSTRACT

Infinite width limit has shed light on generalization and optimization aspects of deep learning by establishing connections between neural networks and kernel methods. Despite their importance, the utility of these kernel methods was limited in large-scale learning settings due to their (super-)quadratic runtime and memory complexities. Moreover, most prior works on neural kernels have focused on the ReLU activation, mainly due to its popularity but also due to the difficulty of computing such kernels for general activations. In this work, we overcome such difficulties by providing methods to work with general activations. First, we compile and expand the list of activation functions admitting exact dual activation expressions to compute neural kernels. When the exact computation is unknown, we present methods to effectively approximate them. We propose a fast sketching method that approximates any multi-layered Neural Network Gaussian Process (NNGP) kernel and Neural Tangent Kernel (NTK) matrices for a wide range of activation functions, going beyond the commonly analyzed ReLU activation. This is done by showing how to approximate the neural kernels using the truncated Hermite expansion of any desired activation functions. While most prior works require data points on the unit sphere, our methods do not suffer from such limitations and are applicable to any dataset of points in $\mathbb{R}^d$. Furthermore, we provide a subspace embedding for NNGP and NTK matrices with near input-sparsity runtime and near-optimal target dimension which applies to any \emph{homogeneous} dual activation functions with rapidly convergent Taylor expansion. Empirically, with respect to exact convolutional NTK (CNTK) computation, our method achieves $106 imes$ speedup for approximate CNTK of a 5-layer Myrtle network on CIFAR-10 dataset.

연구 동기 및 목표

  • 일반적인 활성화 함수에 대해 정확한 NNGP 및 NTK 계산의 계산 병목 현상을 해결하기 위해, 기저 함수가 ReLU 및 소수의 다른 함수에 국한되는 불가능한 커널 표현식으로 인해 제한되는 문제를 해결한다.
  • 무한한 너비 커널 이론을 ReLU를 초월하여, 임의의 매끄러운 활성화 함수에 대해 정확하고 근사적인 신경 커널 계산을 가능하게 한다.
  • 입력 스파arsity에 가까운 런타임과 최적에 가까운 목표 차원을 확보하는 스케칭 기반 방법을 개발하여 일반적인 동차 쌍극성 활성화 함수에 대해 NNGP 및 NTK 행렬을 처리한다.
  • 실세계 데이터셋에서의 방법을 실증적으로 검증하고, 커널 기반 활성화 함수가 유한 너비 네트워크 성능을 향상시킬 수 있음을 보여준다.

제안 방법

  • 모든 매끄러운 활성화 함수를 유한한 에르미트 급수로 표현함으로써, 전개 계수를 이용해 쌍극성 커널을 정확하게 계산할 수 있도록 한다.
  • 초함수 및 특수 함수 항등식을 사용하여 단항식, 가보르, ELU 활성화 함수의 쌍극성 커널에 대해 닫힌 형태의 표현식을 유도한다.
  • 정확한 쌍극성 커널이 알려져 있지 않은 일반적인 활성화 함수의 경우, 에르미트 전개를 사용해 제어 가능한 오차로 커널을 근사한다.
  • 전체 NNGP 및 NTK 행렬을 근사하기 위해 입력 스파arsity에 가까운 런타임과 최적에 가까운 목표 차원을 확보하는 스케칭 알고리즘을 제안한다.
  • 데이터가 단위 구면 위에 있어야 한다는 조건이 필요 없어, R^d 내의 임의의 데이터셋에 적용 가능하다.
  • 에르미트 다항식이 단항식 커널의 랜덤 특징으로 기능하므로, 효율적인 커널 계산이 가능하다는 사실을 활용한다.

실험 결과

연구 질문

  • RQ1GeLU, 사인파, ELU와 같은 광범위한 비-Relu 활성화 함수에 대해 정확한 NNGP 및 NTK 커널을 계산할 수 있는가?
  • RQ2몬테카를로 샘플링이나 정확한 재귀 계산에 의존하지 않고 일반적인 활성화 함수에 대해 효율적으로 신경 커널을 근사할 수 있는가?
  • RQ3입력 스파arsity에 가까운 런타임과 최적에 가까운 차원을 확보하는 스케칭 기반 알고리즘을 다양한 활성화 함수에 대해 설계할 수 있는가?
  • RQ4기존 커널 형태에서 유도된 커널 기반 활성화 함수가 유한 너비 네트워크의 일반화 성능을 어느 정도 향상시킬 수 있는가?

주요 결과

  • 5층 Myrtle 네트워크에서 CIFAR-10에 대해 정확한 순환 NTK(CNTK) 계산 대비 최대 106배의 속도 향상을 달성했으며, 정확도 손실는 최소한이었다.
  • 에르미트 급수와 특수 함수 항등식을 사용하여 단항식, 가보르, ELU 활성화 함수에 대해 정확한 쌍극성 커널 계산이 가능하다.
  • 역공학적 방법을 통해 정규화된 가우시안 커널에서 유도된 새로운 활성화 함수 ABReLU는 5층 Myrtle-5 네트워크에서 ReLU, GeLU, Erf, PReLU와 비교해 가장 높은 테스트 정확도(94.8%)를 기록했다.
  • 스케칭 알고리즘은 입력 스파arsity에 가까운 런타임과 동형 쌍극성 활성화 함수에 대해 최적에 가까운 목표 차원을 확보하는 NNGP 및 NTK 행렬에 대한 부분공간 임베딩을 제공한다. 이는 급수 전개가 빠르게 수렴하는 경우에 해당한다.
  • 이 방법은 R^d 내의 임의의 데이터셋에 적용 가능하며, 이전 연구들과 달리 데이터를 단위 구면으로 정규화할 필요가 없다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.