Skip to main content
QUICK REVIEW

[논문 리뷰] Diving into the shallows: a computational perspective on large-scale shallow learning

Siyuan Ma, Mikhail Belkin|arXiv (Cornell University)|2017. 03. 30.
Stochastic Gradient Optimization Techniques참고 문헌 18인용 수 10
한 줄 요약

이 논문은 대규모 커널 방법에 부드러운 커널을 사용할 때 경사하강법의 근본적인 계산적 한계를 규명한다: 다항식 시간 내에서 근사할 수 있는 함수는 매우 부드러운 함수에 국한되며, 이는 심각한 과소적합을 초래한다. 이를 극복하기 위해 저자는 단순하고 SGD와 호환되는 전처리 방법인 EigenPro 반복법을 제안한다. 이 방법은 몇 개의 근사 고유벡터를 사용하여 수렴 속도와 성능을 크게 향상시키며, 훨씬 낮은 계산 비용으로 최신 기술 수준의 성능을 달성하거나 초월한다.

ABSTRACT

In this paper we first identify a basic limitation in gradient descent-based optimization methods when used in conjunctions with smooth kernels. An analysis based on the spectral properties of the kernel demonstrates that only a vanishingly small portion of the function space is reachable after a polynomial number of gradient descent iterations. This lack of approximating power drastically limits gradient descent for a fixed computational budget leading to serious over-regularization/underfitting. The issue is purely algorithmic, persisting even in the limit of infinite data. To address this shortcoming in practice, we introduce EigenPro iteration, based on a preconditioning scheme using a small number of approximately computed eigenvectors. It can also be viewed as learning a new kernel optimized for gradient descent. It turns out that injecting this small (computationally inexpensive and SGD-compatible) amount of approximate second-order information leads to major improvements in convergence. For large data, this translates into significant performance boost over the standard kernel methods. In particular, we are able to consistently match or improve the state-of-the-art results recently reported in the literature with a small fraction of their computational budget. Finally, we feel that these results show a need for a broader computational perspective on modern large-scale learning to complement more traditional statistical and convergence analyses. In particular, many phenomena of large-scale high-dimensional inference are best understood in terms of optimization on infinite dimensional Hilbert spaces, where standard algorithms can sometimes have properties at odds with finite-dimensional intuition. A systematic analysis concentrating on the approximation power of such algorithms within a budget of computation may lead to progress both in theory and practice.

연구 동기 및 목표

  • 대규모 데이터셋에서 부드러운 커널 방법에 대한 경사하강법의 핵심 알고리즘적 한계를 규명하고 분석한다.
  • 표준 경사하강법이 실용적인 계산 시간 내에서 덜 부드러운 현실적인 목표 함수를 근사하지 못하는 이유를 설명한다.
  • 완전한 2차 방법에 의존하지 않고도 이 한계를 극복할 수 있는 실용적이고 효율적인 알고리즘을 개발한다.
  • 간단한 알고리즘 수정이 대규모 데이터에서 얕은 학습 방법의 성능을 크게 향상시킬 수 있음을 보여준다.
  • 伝통적인 통계 분석과 보완되는 계산적 관점에서 대규모 학습을 바라보도록 주장한다.

제안 방법

  • 커널 행렬의 소수의 근사 고유벡터를 사용하는 전처리된 경사하강법인 EigenPro 반복법을 제안한다.
  • 부드러운 커널의 스펙트럼 성질을 이용하여, 경사하강법이 빠른 스펙트럼 감쇠로 인해 느리게 수렴하며, 도달 가능한 함수 공간이 제한됨을 보여준다.
  • 무한차원 힐버트 공간에서 문제를 재구성함으로써, 이 문제가 통계적 문제가 아니라 알고리즘적 문제임을 드러내며, 무한한 데이터가 있더라도 여전히 지속됨을 밝힌다.
  • 계산적으로 효율적이고 SGD와 호환되는 방법을 도입하여, 저랭크 고유공간을 통해 헤시안을 근사함으로써 수렴 속도를 향상시킨다.
  • 커널 리지 회귀 및 분류에 이 방법을 적용하여, 다양한 데이터셋에서 일관된 성능 향상을 보였다.
  • 랜덤 푸리에 특징을 사용하여 이 방법을 대규모 데이터셋으로 확장하면서도 정확성과 효율성을 유지하였다.

실험 결과

연구 질문

  • RQ1왜 표준 경사하강법은 대규모 데이터셋에서 부드러운 커널 방법에 적용했을 때 효율적으로 수렴하지 못하는가?
  • RQ2부드러운 커널에 대한 경사하강법의 근본적인 알고리즘적 한계는 무엇이며, 이는 과소적합과 과도한 정규화를 초래하는가?
  • RQ31차 방법에 대한 단순하고 저비용의 수정이 대규모 커널 학습에서 수렴 속도를 크게 향상시키기 위해 충분한 2차 정보를 통합할 수 있는가?
  • RQ4이러한 수정이 계산 예산의 일부분으로서 최신 기술 수준의 성능을 달성하거나 초월할 수 있는 정도는 어느 정도인가?
  • RQ5커널의 부드러움과 목표 함수의 비부드러움 간의 불일치는 실용적인 분류 작업에서 일반적이고 핵심적인 문제인가?

주요 결과

  • 부드러운 커널을 사용한 경사하강법는 빠른 스펙트럼 감쇠로 인해 다항식 시간 내에 함수 공간의 극히 작은 부분에만 도달할 수 있다.
  • 알고리즘적 제약로 인해, 무한한 데이터가 있더라도 덜 부드러운 목표 함수를 실용적인 반복 횟수 내에 근사하지 못한다.
  • 소수의 근사 고유벡터를 사용하는 EigenPro 반복법는 수렴 속도와 모델 정확도를 크게 향상시킨다.
  • MNIST에서는 4.8 GPU 시간 내에 0.70%의 테스트 오차를 기록하여 최신 기술 수준의 결과(0.72%)를 달성했고, 시간은 15分의 1이며 반복 횟수도 적다.
  • TIMIT에서는 3.2 GPU 시간 내에 31.7%의 오차를 기록하여, 이전 결과보다 우수하며, 이전 결과는 512개의 코어 또는 1024개의 vCPU에서 7.5시간이 소요되었다.
  • SUSY에서는 0.1 GPU 시간 내에 19.8%의 오차를 기록하여, 이전 방법이 IBM POWER8에서 0.6시간이 소요된 것보다 뚜렷이 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.