Skip to main content
QUICK REVIEW

[논문 리뷰] GPU Accelerated Sub-Sampled Newton's Method

Sudhir B. Kylasa, Farbod Roosta-Khorasani|arXiv (Cornell University)|2018. 02. 26.
Stochastic Gradient Optimization Techniques참고 문헌 28인용 수 5
한 줄 요약

이 논문은 대규모 머신러닝에서 빠르고 안정적인 수렴을 달성하기 위해 무작위로 샘플링된 헤시안과 기울기 정보를 활용하는 GPU 가속 서브샘플드 뉴턴 방법을 제안한다. GPU의 병렬 처리 능력을 활용하여, 최소한의 하이퍼파rameter 조정으로도 밀리초 내에 높은 테스트 정확도를 달성하며, 1순서 방법 대비 최대 100배 빠른 속도를 기록한다.

ABSTRACT

First order methods, which solely rely on gradient information, are commonly used in diverse machine learning (ML) and data analysis (DA) applications. This is attributed to the simplicity of their implementations, as well as low per-iteration computational/storage costs. However, they suffer from significant disadvantages; most notably, their performance degrades with increasing problem ill-conditioning. Furthermore, they often involve a large number of hyper-parameters, and are notoriously sensitive to parameters such as the step-size. By incorporating additional information from the Hessian, second-order methods, have been shown to be resilient to many such adversarial effects. However, these advantages of using curvature information come at the cost of higher per-iteration costs, which in \enquote{big data} regimes, can be computationally prohibitive. In this paper, we show that, contrary to conventional belief, second-order methods, when implemented appropriately, can be more efficient than first-order alternatives in many large-scale ML/ DA applications. In particular, in convex settings, we consider variants of classical Newton extsf{'}s method in which the Hessian and/or the gradient are randomly sub-sampled. We show that by effectively leveraging the power of GPUs, such randomized Newton-type algorithms can be significantly accelerated, and can easily outperform state of the art implementations of existing techniques in popular ML/ DA software packages such as TensorFlow. Additionally these randomized methods incur a small memory overhead compared to first-order methods. In particular, we show that for million-dimensional problems, our GPU accelerated sub-sampled Newton extsf{'}s method achieves a higher test accuracy in milliseconds as compared with tens of seconds for first order alternatives.

연구 동기 및 목표

  • 불량한 조건을 가진 머신러닝 문제에서 1순서 방법의 낮은 수렴 성능과 높은 하이퍼파rameter 민감도를 해결한다.
  • 빅데이터 환경에서 전통적 뉴턴 방법의 높은 반복당 비용 문제를 해결하기 위해 기울기와 헤시안의 무작위 서브샘플링을 사용한다.
  • 현대 하드웨어, 특히 GPU에서의 실용성과 효율성을 입증함으로써 2순서 방법이 대규모 머신러닝 응용 분야에 실제로 적용될 수 있음을 보여준다.
  • 서브샘플드 뉴턴 방법을 GPU 가속화하여, 텐서플로우 등 최첨단 1순서 구현보다도 빠르고 정확도가 높은 성능을 내는지를 입증한다.
  • 뉴턴 유형 방법에서 자연스러운 스텝 사이즈 α=1을 활용함으로써 광범위한 하이퍼파rameter 튜닝이 필요로 하는 문제를 줄인다.

제안 방법

  • 뉴턴 유형 방법에서 헤시안과 기울기의 무작위 서브샘플링을 사용하여 반복당 비용을 n에 대해 근사적으로 일정한 수준으로 줄인다.
  • CUDA를 활용하여 행렬 연산과 선형 시스템 해법을 병렬화한 GPU 최적화 서브샘플드 뉴턴 방법의 변종을 구현한다.
  • 반복적 해법(예: 공액 기울기)을 사용해 뉴턴 시스템의 근사 해를 구하고 조기 종료 전략을 적용함으로써 추가로 계산 비용을 절감한다.
  • 곡률 정보 덕분에 메서드가 본질적으로 안정적이므로, 선색색색 전략을 거의 사용하지 않으며, 수동 튜닝 의존도를 낮춘다.
  • 완전한 행렬을 저장하지 않고 서브샘플드 헤시안과 기울기 근사치만 유지함으로써 낮은 메모리 오버헤드를 유지한다.
  • 머신러닝에서 흔한 유한합 문제, 예를 들어 경험적 위험 최소화 문제를 지원하는 확장 가능한 프레임워크에 메서드를 통합한다.

실험 결과

연구 질문

  • RQ1GPU에서 가속화된 서브샘플드 뉴턴 방법은 대규모 머신러닝 문제에서 수렴 속도와 최종 테스트 정확도 측면에서 1순서 방법을 능가할 수 있는가?
  • RQ2GPU 가속화가 빅데이터 환경에서 2순서 방법의 높은 반복당 비용 문제를 어느 정도 완화하는가?
  • RQ3서브샘플드 뉴턴 방법은 1순서 방법(SGD, Adam, RMSProp 등)과 비교해 불량한 조건 문제에 대해 얼마나 뛰어난 내성과 안정성을 보이는가?
  • RQ41순서 방법은 학습률 선택에 얼마나 민감한가? 뉴턴 유형 방법은 하이퍼파rameter 튜닝이 필요한 정도를 줄일 수 있는가?
  • RQ5서브샘플드 뉴턴 방법은 백만 차원 문제에서도 밀리초 내에 높은 테스트 정확도를 달성할 수 있는가? 이는 1순서 방법이 수십 초가 걸리는 상황과 대비된다.

주요 결과

  • 백만 차원 문제에서 GPU 가속 서브샘플드 뉴턴 방법은 밀리초 내에 높은 테스트 정확도를 달성하지만, 1순서 방법은 수십 초가 소요된다.
  • Gisette 데이터셋에서 FullNewton은 0.6초(11회 반복) 내에 98.3%의 테스트 정확도를 달성했으며, 1순서 방법은 100회 반복을 거쳐 97%에 도달했다.
  • Gisette에서 SubsampledNewton-100은 34회 반복 내에 98%의 테스트 정확도를 달성했고, 1순서 방법은 특히 20% 배치 크기에서 느린 진전을 보였다.
  • Real-Sim 데이터셋에서 뉴턴 유형 방법은 유사하거나 더 짧은 시간 내에 1순서 방법보다 유사하거나 낮은 목적 함수 값을 달성했으며, FullNewton은 단 2회 반복 만에 97.3% 정확도를 달성했다.
  • SGD with Momentum, Adagrad, RMSProp, Adam과 같은 1순서 방법은 학습률에 매우 민감했다: 작은 값은 정체를 유도하고, 큰 값은 발산을 유도했으며, 유의미한 성능을 내기 위한 범위는 매우 좁았다.
  • 서브샘플드 뉴턴 방법은 자연스러운 스텝 사이즈 α=1을 사용하며, 선색색색 전략도 거의 필요로 하지 않지만, 1순서 방법은 종종 광범위한 튜닝과 초기 스텝 사이즈 선택에 민감하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.