Skip to main content
QUICK REVIEW

[논문 리뷰] Randomized Block Cubic Newton Method

Nikita Doikov, Peter Richtárik|arXiv (Cornell University)|2018. 02. 12.
Stochastic Gradient Optimization Techniques참고 문헌 22인용 수 3
한 줄 요약

이 논문은 부드럽고 두 번 미분 가능한, 그리고 비부드러운 성분으로 구성된 복합 볼록 함수를 최소화하기 위한 새로운 이阶 최적화 알고리즘인 랜덤라이즈드 블록 큐빅 뉴턴(RBCN) 방법을 소개한다. 블록-좌표 랜덤라이제이션과 큐빅 정규화, 프록시 모델링을 융합함으로써 RBCN는 최적의 수렴 속도—$\mathcal{O}(1/\epsilon)$, $\mathcal{O}(1/\sqrt{\epsilon})$, 및 $\mathcal{O}(\log(1/\epsilon))$—를 달성하며, 정규화된 최소 제곱, 로지스틱 회귀, 포아송 회귀와 같은 기계학습 문제에서 최신 기술보다 뛰어난 성능을 보인다.

ABSTRACT

We study the problem of minimizing the sum of three convex functions: a differentiable, twice-differentiable and a non-smooth term in a high dimensional setting. To this effect we propose and analyze a randomized block cubic Newton (RBCN) method, which in each iteration builds a model of the objective function formed as the sum of the natural models of its three components: a linear model with a quadratic regularizer for the differentiable term, a quadratic model with a cubic regularizer for the twice differentiable term, and perfect (proximal) model for the nonsmooth term. Our method in each iteration minimizes the model over a random subset of blocks of the search variable. RBCN is the first algorithm with these properties, generalizing several existing methods, matching the best known bounds in all special cases. We establish ${\cal O}(1/ε)$, ${\cal O}(1/\sqrtε)$ and ${\cal O}(\log (1/ε))$ rates under different assumptions on the component functions. Lastly, we show numerically that our method outperforms the state-of-the-art on a variety of machine learning problems, including cubically regularized least-squares, logistic regression with constraints, and Poisson regression.

연구 동기 및 목표

  • 부드럽고, 두 번 미분 가능한, 그리고 비부드러운 성분을 갖는 복합 볼록 문제를 효율적으로 다룰 수 있는 이阶 최적화 방법을 개발하는 것.
  • 블록-좌표 랜덤라이제이션을 큐빅 정규화와 프록시 모델링과 융합하여 계산 비용을 줄이면서도 전역 수렴 보장을 유지하는 것.
  • 큐빅 뉴턴, 스위치드 뉴턴, 프록시 기반 경사 하강법 등의 기존 방법들을 통합된 프레임워크로 일반화하고 수렴 속도를 향상시키는 것.
  • 성분 함수에 대한 다양한 부드러움 가정 하에서 이론적 수렴 속도를 확립하는 것.
  • 실제 기계학습 작업 전반에서 총 계산 시간 측면에서 최신 기술보다 RBCN이 뛰어나다는 경험적 결과를 제시하는 것.

제안 방법

  • RBCN는 목적 함수의 모델을 세 가지 별개의 근사 방법을 사용하여 구성한다: 부드러운 성분 $g(x)$에 대해 선형 모델에 제곱 정규화를 적용하고, 두 번 미분 가능한 성분 $\phi(x)$에 대해 이차 모델에 큐빅 정규화를 적용하며, 비부드러운 성분 $\psi(x)$에 대해 완벽한(프록시) 모델을 사용한다.
  • 각 반복 단계에서, 변수 $x$의 랜덤으로 선택된 블록 부분집합에 대해 이 복합 모델을 최소화함으로써, 블록 구조를 활용해 반복 계산 비용을 감소시킨다.
  • 고차원 설정에서 $n$이 매우 클 경우에도 확장 가능한 성능을 확보하기 위해, 블록을 랜덤으로 샘플링하는 전략(특히 $\tau$-좋은 샘플링)을 사용한다.
  • 두 번 미분 가능한 성분 $\phi_i(x_{(i)})$에 대해, 곡률를 더 잘 포착하기 위해 이차 모델보다 큐빅으로 정규화된 이阶 모델을 적용한다.
  • 전역 수렴과 안정성을 확보하기 위해 헤시안의 리프시츠 상수를 활용하며, $H_k$는 선택된 블록들에 대한 $c_i$의 최댓값으로 선택된다.
  • 알고리즘은 $\psi_i(x_{(i)})$에 대해 프록시 기반으로 설계되어, 근사 없이 정확한 항을 최소화함으로써 수렴 보장을 유지한다.

실험 결과

연구 질문

  • RQ1큐빅 정규화와 프록시 모델링을 융합한 랜덤라이즈드 블록 방법을 설계하여 복합 볼록 문제에 대해 최적의 수렴 속도를 달성할 수 있는가?
  • RQ2랜덤라이즈드 이阶 최적화 방법에서 블록 크기의 선택이 수렴 속도와 계산 비용에 어떤 영향을 미치는가?
  • RQ3제안된 방법이 큐빅 뉴턴 및 스위치드 뉴턴 등의 기존 알고리즘을 일반화하면서도 그 수렴 속도를 유지하거나 향상시킬 수 있는가?
  • RQ4성분 함수에 대한 다양한 부드러움 가정 하에서 이론적 수렴 속도는 어떻게 되는가?
  • RQ5실제 기계학습 문제에서 최신 기술보다 성능이 뛰어나다는 것이 경험적으로 입증되는가?

주요 결과

  • RBCN는 성분 함수에 대한 다양한 가정 하에서 $\mathcal{O}(1/\epsilon)$, $\mathcal{O}(1/\sqrt{\epsilon})$, 및 $\mathcal{O}(\log(1/\epsilon))$의 수렴 속도를 달성하며, 모든 특수 케이스에서 알려진 최고의 경계와 일치한다.
  • 수치 실험 결과, 중간 크기의 블록(예: 25–50개의 좌표)을 사용할 경우 총 계산 시간이 최소화되며, 반복 속도와 반복당 비용을 균형 있게 조절한다.
  • 큐빅으로 정규화된 최소 제곱 문제에 대한 시뮬레이션 결과, RBCN는 함수 잔여치의 정확도 $10^{-12}$에 도달하는 데 총 시간 측면에서 다른 방법보다 뛰어난 성능을 보였다.
  • $\ell_2$-정규화된 로지스틱 회귀 문제에서, RBCN는 25–50개의 블록 크기를 사용할 경우 블록-좌표 기반 경사 하강법과 다른 방법들보다 계산 효율성이 뛰어나다.
  • 포아송 회귀 작업에서는 RBCN가 동일한 정확도에 도달하기 위해 SDCA 및 SDNA보다 더 적은 데이터 접근 횟수를 요구하여, 경험적으로 뛰어난 효율성을 입증했다.
  • 특히 $m=1000$에서 $m=319$개의 샘플을 갖는 시뮬레이션 및 실제 데이터셋에서, RBCN는 SDNA와 유사한 계산 효율성을 유지하면서도 더 빠른 수렴 속도를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.