Skip to main content
QUICK REVIEW

[논문 리뷰] An Exponential Improvement on the Memorization Capacity of Deep Threshold Networks

Shashank Rajput, Kartik K. Sreenivasan|arXiv (Cornell University)|2021. 06. 14.
Stochastic Gradient Optimization Techniques참고 문헌 24인용 수 9
한 줄 요약

이 논문은 최소 상호점 거리 δ에 대한 의존도를 지수적에서 거의 선형으로 줄임으로써 기억 용량을 기하급수적으로 향상시키는 깊은 임계값 신경망의 새로운 구성법을 제안한다. 첫 번째 레이어에서만 가우시안 가중치를 사용하고 이후 레이어에서는 이진수/정수 가중치를 사용함으로써, 기억 용량을 Õ(1/δ + √n)개의 뉴런과 Õ(d/δ + n)개의 가중치로 달성할 수 있으며, 이는 이전 연구에서 δ에 대해 지수적 의존도가 필요로 했던 것에 비해 크게 향상된 결과이다.

ABSTRACT

It is well known that modern deep neural networks are powerful enough to memorize datasets even when the labels have been randomized. Recently, Vershynin (2020) settled a long standing question by Baum (1988), proving that \emph{deep threshold} networks can memorize $n$ points in $d$ dimensions using $\widetilde{\mathcal{O}}(e^{1/δ^2}+\sqrt{n})$ neurons and $\widetilde{\mathcal{O}}(e^{1/δ^2}(d+\sqrt{n})+n)$ weights, where $δ$ is the minimum distance between the points. In this work, we improve the dependence on $δ$ from exponential to almost linear, proving that $\widetilde{\mathcal{O}}(\frac{1}δ+\sqrt{n})$ neurons and $\widetilde{\mathcal{O}}(\frac{d}δ+n)$ weights are sufficient. Our construction uses Gaussian random weights only in the first layer, while all the subsequent layers use binary or integer weights. We also prove new lower bounds by connecting memorization in neural networks to the purely geometric problem of separating $n$ points on a sphere using hyperplanes.

연구 동기 및 목표

  • Baum(1988)가 제기한 열린 문제인 더 깊은 임계값 네트워크가 기억 용량에 대해 O(√n)개의 뉴런을 달성할 수 있는지 여부를 다루는 것.
  • 이전 연구에서의 제약 조건이었던 δ(최소 상호점 거리)에 대한 지수적 의존도를 줄이는 것, 예를 들어 Vershynin(2020)의 연구에서 나타난 한계를 해결하는 것.
  • 데이터 포인트가 단위 구면 위에 있어야 한다는 제한적인 가정을 제거하고, 대신 ℓ² 노름이 유계임만 요구하는 것.
  • δ-분리 조건 하에서 기억 용량을 위해 필요한 뉴런 수와 가중치 수에 대한 더 엄밀한 상한 및 하한을 설정하는 것.

제안 방법

  • 첫 번째 레이어에서만 i.i.d. 가우시안 가중치를 사용하고, 이후 모든 레이어에서는 유계 정수 가중치를 사용하는 깊은 임계값 네트워크를 구성하는 것.
  • 첫 번째 레이어를 사용해 d차원 공간 내의 n개의 δ-분리된 점들을 선형적으로 분리될 수 있도록 더 높은 차원의 공간으로 투영하는 것.
  • 구면 상의 δ-분리된 점들이 초평면을 통해 분리될 수 있다는 기하학적 성질을 이용하고, 이를 노름이 유계인 점들로 확장하는 것.
  • 확률론적 추론과 커버링/패킹 경계를 적용하여, 기억 용량을 위해 크기가 Õ(n + log log |Cδ/2|)인 가설 클래스가 충분함을 보이는 것.
  • 모든 가능한 n점 부분집합과 레이블링에 대해 유니언 바운드를 적용하여, 어떤 레이블링도 기억할 수 있는 네트워크의 존재를 보장하는 것.
  • 기억 용량을 구면 상의 점들을 초평면으로 분리하는 문제와 연결하여 하한을 증명하고, 최소 Ω(n) 비트와 Ω(log log |Pδ|) 비트가 필요하다는 것을 보이는 것.

실험 결과

연구 질문

  • RQ1깊은 임계값 네트워크의 기억 용량에서 δ에 대한 지수적 의존도를 거의 선형으로 개선시킬 수 있는가?
  • RQ2점들이 구면 위에 있어야 한다는 조건 없이도 O(√n)개의 뉴런으로 기억 용량을 달성할 수 있는가?
  • RQ3첫 번째 레이어에만 가우시안 가중치를 사용하고 깊은 레이어에는 정수 가중치만 사용하는 깊은 임계값 네트워크가 최적의 기억 용량을 달성할 수 있는가?
  • RQ4δ-분리 조건 하에서 기억 용량을 위해 필요한 뉴런 수와 가중치 수의 기본 정보 이론적 한계는 무엇인가?

주요 결과

  • 논문은 d차원 공간 내의 크기가 n인 δ-분리된 데이터셋을 기억하기 위해 Õ(1/δ + √n)개의 뉴런과 Õ(d/δ + n)개의 가중치가 충분함을 입증한다.
  • δ에 대한 의존도는 이전의 지수적 형태(e^{1/δ²})에서 거의 선형 형태(1/δ)로 개선되어 근본적인 정량적 향상이 이루어졌다.
  • 구성법은 실수 값의 가우시안 가중치를 사용하는 레이어를 첫 번째 레이어에만 요구하며, 이후 모든 레이어는 유계 정수 가중치를 사용하므로 하드웨어 및 학습 고려사항을 단순화한다.
  • 점들이 구면 위에 있어야 한다는 조건을 제거하고, 대신 ℓ² 노름이 유계임만 요구함으로써 적용 범위를 넓혔다.
  • 새로운 하한을 통해 최소 Ω(n) 비트의 정보가 기억 용량을 위해 필요하고, δ-분리 조건으로 인해 추가로 Ω(log log |Pδ|) 비트가 더 필요하다는 것을 보이며, 이는 정보 이론적 한계와 일치한다.
  • 네트워크의 깊이는 O(log(log n)/δ)층이며, 첫 번째 레이어는 Õ(log n / δ)개의 뉴런과 Õ(d log n / δ)개의 가중치를 가진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.