Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptively Accelerating Cubic Regularized Newton's Methods for Convex Optimization via Random Sampling

Xi Chen, Bo Jiang|arXiv (Cornell University)|2018. 02. 15.
Sparse and Compressive Sensing Techniques참고 문헌 51인용 수 12
한 줄 요약

이 논문은 대규모 볼록 최적화를 위한 적응형, 부분 샘플링된 삼차 정규화 뉴턴 방법을 제안하며, 헤시안 행렬을 근사하기 위해 균일 또는 비균일 샘플링을 사용한다. 높은 확률로 O(ε⁻¹ᐟ³) 반복 복잡도를 달성하면서도, 최악의 경우 O(log(ε⁻¹)ε⁻⁵ᐟ⁶)의 복잡도를 유지하여 로지스틱 회귀 작업에서 가속화를 입증한다.

ABSTRACT

In this paper, we consider an unconstrained optimization model where the objective is a sum of a large number of possibly nonconvex functions, though overall the objective is assumed to be smooth and convex. Our bid to solving such model uses the framework of cubic regularization of Newton's method. As well known, the crux in cubic regularization is its utilization of the Hessian information, which may be computationally expensive for large-scale problems. To tackle this, we resort to approximating the Hessian matrix via sub-sampling. In particular, we propose to compute an approximated Hessian matrix by either extit{uniformly}\/ or extit{non-uniformly}\/ sub-sampling the components of the objective. Based upon such sampling strategy, we develop accelerated adaptive cubic regularization approaches and provide theoretical guarantees on global iteration complexity of $O(\epsilon^{-1/3})$ with high probability, which matches that of the original accelerated cubic regularization methods \cite{Jiang-2017-Unified} using the extit{full}\/ Hessian information. Interestingly, we show that in the worst case scenario our algorithm still achieves an $O\left(\log(\epsilon^{-1})\epsilon^{-5/6} ight)$ iteration complexity bound. The performances of the proposed methods on the regularized logistic regression problems show a clear effect of acceleration in terms of the epoch counts on several real data sets.

연구 동기 및 목표

  • 대규모 문제에서 삼차 정규화 뉴턴 방법의 헤시안 행렬 계산 비용이 높다는 문제를 해결하기 위해.
  • 목표 함수의 구성 요소에 대한 균일 및 비균일 샘플링을 통해 효율적인 헤시안 행렬 근사 전략을 개발하기 위해.
  • 부분 샘플링된 헤시안 정보를 사용하면서도 가속화된 삼차 정규화의 최적 O(ε⁻¹ᐟ³) 반복 복잡도를 유지하기 위해.
  • 샘플링 기반 헤시안 근사 하에서 수렴에 대한 높은 확률 보장을 이론적으로 확보하기 위해.
  • 실세계 정규화된 로지스틱 회귀 데이터셋에서 에포크 수 측면에서의 실증적 가속화를 검증하기 위해.

제안 방법

  • 합 구조의 목표 함수에서 개별 구성 요소의 부분 샘플링을 통해 헤시안 행렬을 근사한다.
  • 균일 및 비균일 샘플링 전략을 모두 활용하여 헤시안 근사 행렬을 구성하며, 비균일 샘플링은 더 정보가 풍부한 구성 요소를 우선시한다.
  • 로컬 곡률 추정에 기반해 정규화 파라미터를 조정하는 적응형 삼차 정규화를 뉴턴 방법 프레임워크에 통합한다.
  • 계산 비용을 줄이면서도 수렴 보장을 유지하기 위해 랜덤화된 헤시안 근사를 사용한다.
  • 샘플링 하에서 반복 복잡도의 경계를 이론적으로 유도하여 높은 확률 수렴을 보여준다.

실험 결과

연구 질문

  • RQ1삼차 정규화 뉴턴 방법에서 부분 샘플링된 헤시안 근사가 전체 헤시안 방법의 O(ε⁻¹ᐟ³) 반복 복잡도를 유지할 수 있는가?
  • RQ2헤시안 근사에서 비균일 샘플링과 균일 샘플링 간의 수렴 속도 및 안정성 측면에서의 비교는 어떠한가?
  • RQ3제안된 부분 샘플링 방법의 최악의 경우 반복 복잡도는 무엇이며, 전체 헤시안 대비 어떻게 비교되는가?
  • RQ4제안된 방법은 실세계 기계 학습 문제에서 에포크 수 측면에서 실질적인 가속화를 달성할 수 있는가?
  • RQ5부분 샘플링 하에서 수렴에 대한 높은 확률 보장은 어떤 이론적 근거로 확보될 수 있는가?

주요 결과

  • 제안된 방법은 높은 확률로 O(ε⁻¹ᐟ³) 반복 복잡도를 달성하며, 전체 헤시안 가속화 삼차 정규화의 이론적 경계와 일치한다.
  • 최악의 경우, 방법은 O(log(ε⁻¹)ε⁻⁵ᐟ⁶)의 반복 복잡도를 유지하며, 기존 알려진 경계와 경쟁 가능하다.
  • 비균일 샘플링은 헤시안 근사 품질을 향상시켜 실질적인 수렴 속도 향상에 기여한다.
  • 정규화된 로지스틱 회귀에 대한 실증 결과는 여러 실세계 데이터셋에서 에포크 수 측면에서 명확한 가속화를 보여준다.
  • 부분 샘플링을 통해 헤시안 계산 비용을 크게 줄이면서도 강력한 수렴 보장을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.