Skip to main content
QUICK REVIEW

[논문 리뷰] An inexact subsampled proximal Newton-type method for large-scale machine learning

Xuanqing Liu, Cho‐Jui Hsieh|arXiv (Cornell University)|2017. 08. 28.
Sparse and Compressive Sensing Techniques참고 문헌 8인용 수 11
한 줄 요약

이 논문은 대규모 정규화된 유한합 최적화를 위한 비정확한 부분 샘플링 프락시멀 뉴턴형 방법을 제안한다. 이 방법은 부분 샘플링된 헤시안 근사와 가속된 스 tochastic 1차 방법을 조합하여 하위문제를 효율적으로 해결한다. 이 방법은 $\tilde{\mathcal{O}}(d(n + \sqrt{\kappa d})\log(1/\epsilon))$ FLOPS의 복잡도를 달성하며, 부드러운 정규화자에 대해서는 LiSSA의 효율성과 동일하고, $n > d$일 때는 가속된 1차 방법보다 뛰어나다. 비부드러운 정규화자, 예를 들어 $\ell_1$도 지원한다.

ABSTRACT

We propose a fast proximal Newton-type algorithm for minimizing regularized finite sums that returns an $ε$-suboptimal point in $ ilde{\mathcal{O}}(d(n + \sqrt{κd})\log(\frac{1}ε))$ FLOPS, where $n$ is number of samples, $d$ is feature dimension, and $κ$ is the condition number. As long as $n > d$, the proposed method is more efficient than state-of-the-art accelerated stochastic first-order methods for non-smooth regularizers which requires $ ilde{\mathcal{O}}(d(n + \sqrt{κn})\log(\frac{1}ε))$ FLOPS. The key idea is to form the subsampled Newton subproblem in a way that preserves the finite sum structure of the objective, thereby allowing us to leverage recent developments in stochastic first-order methods to solve the subproblem. Experimental results verify that the proposed algorithm outperforms previous algorithms for $\ell_1$-regularized logistic regression on real datasets.

연구 동기 및 목표

  • 정확한 프락시멀 뉴턴 방법의 계산 비효율성을 해결하기 위해, 효율적인 헤시안 근사를 가능하게 함으로써 대규모 머신러닝 문제에 적용 가능한 방법을 개발한다.
  • 부드럽지 않은 정규화자, 예를 들어 $\ell_1$과 같은 정규화자에도 두 번째 차수 방법을 확장하면서도 빠른 수렴 속도를 유지한다.
  • 최신의 스 tochastic 1차 방법과 LiSSA와 경쟁 가능한 계산 복잡도를 달성하며, 특히 샘플 수 $n$이 차원 $d$를 초과할 경우에 유리하다.
  • 부드러운 부분의 유한합 구조를 부분 샘플링된 헤시안 근사를 통해 유지하여, 분산 감소 1차 방법을 효율적으로 사용해 하위문제를 해결할 수 있도록 한다.

제안 방법

  • 계산 비용을 줄이기 위해 리지드 스코어 샘플링을 사용해 부분 샘플링된 헤시안 $B_t$를 근사하여 프락시멀 뉴턴 하위문제를 수립한다.
  • 현재 반복값 $w_t$ 주변에서 부드러운 부분 $f(w)$에 대한 2차 근사를 사용하여, 기울기, 헤시안 근사, 그리고 정규화자 $R(w)$를 포함한 하위문제를 도출한다.
  • Catalyst 가속 SVRG를 사용해 하위문제를 근사적으로 해결하며, 수렴을 유지하기 위해 기울기 잔차 $\|r_t\|_{B_t}^*$ 가 $\theta_t \|v_t\|_{B_t}$ 이하로 제한된다.
  • 두 단계에서 이론적 조건에 기반한 적응형 스텝 사이즈를 사용한다: 제1단계는 전역 수렴을 위한 것이고, 제2단계는 국소 초선형 수렴을 위한 것이다.
  • 부분 샘플링을 통해 헤시안 계산만을 수행함으로써 부드러운 성분의 유한합 구조를 유지하여, 분산 감소 1차 해법기를 효율적으로 활용할 수 있도록 한다.
  • 하위문제 정확도를 제어하고 상대 잔차 노름 기반 정지 조건을 사용함으로써 이론적 수렴 보장을 확보한다.

실험 결과

연구 질문

  • RQ1비부드러운 정규화자를 가진 대규모 머신러닝 문제에 대해, 헤시안을 부분 샘플링함으로써 프락시멀 뉴턴형 방법을 확장할 수 있는가?
  • RQ2하위문제 해결에 부분 샘플링된 헤시안 근사와 가속된 1차 방법을 조합하면, 최신의 스 tochastic 1차 방법보다 더 낮은 계산 복잡도를 가지는가?
  • RQ3이러한 방법의 이론적 FLOP 복잡도는 무엇이며, 표준 가정 하에서 LiSSA와 가속된 1차 방법과 비교해 어떻게 되는가?
  • RQ4실제 데이터셋에서 $\ell_1$-정규화된 로지스틱 회귀에 대해 이 방법은 실용적으로 어떻게 성능을 내는가, 특히 $n > d$일 경우에?
  • RQ5내부 반복 수와 같은 하이퍼파ram터 선택에 대해 강건성을 유지하면서도 뛰어난 수렴 속도를 달성할 수 있는가?

주요 결과

  • 제안된 방법은 이론적으로 $\tilde{\mathcal{O}}(d(n + \sqrt{\kappa d})\log(1/\epsilon))$ FLOPS의 복잡도를 달성하며, 부드러운 정규화자에 대해서는 LiSSA의 효율성과 동일하고, $n > d$일 경우 가속된 1차 방법보다 향상된다.
  • Covtype 및 MNIST 데이터셋에서 LIBLINEAR, SVRG, SAGA보다 실행 시간이 빠르며, 특히 큰 정규화($\lambda = 10^{-3}$) 조건에서 근사 초선형 수렴을 보여 near-superlinear 수렴 특성을 확보한다.
  • 내부 반복 수의 선택에 대해 강건하며, $\texttt{inner} = 2$에서 $6$ 사이에서는 성능이 안정적이다. 다만 $\texttt{inner} = 1$일 경우 하위문제 정확도가 부족해 성능이著しく 열 劣해진다.
  • Realsim 데이터셋에서는 $\lambda$가 클 경우 LIBLINEAR과 유사한 성능을 보이나, 희소성 활용이 부족해 전체적으로 느리다. 이는 일반성과 데이터 특화 최적화 사이의 상충관계를 보여준다.
  • 정규화 강도 $\lambda$가 증가할수록 수렴 속도가著히 향상되며, 이는 영점 초기화 상태에서 더 희소한 해에 더 빨리 도달하기 때문이다. 이는 문헌에서 이전에 관찰된 바와 일치한다.
  • 실험 결과는 이 방법이 뿐만 아니라 이론적 복잡도도 뛰어나고, 실세계 데이터셋에서도 뛰어난 실용적 성능을 보임을 확인하며, 효율성과 강건성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.