Skip to main content
QUICK REVIEW

[논문 리뷰] Second-Order Methods with Cubic Regularization Under Inexact Information

Saeed Ghadimi, Han Liu|arXiv (Cornell University)|2017. 10. 16.
Sparse and Compressive Sensing Techniques참고 문헌 11인용 수 20
한 줄 요약

이 논문은 충족 가능한 Hessian 행렬을 사용하여 계산 비용을 줄이는 복합 정규화를 통한 비정확한 2차 수준 방법을 제안한다. Hessian 근사 오차에 대한 온건한 가정 하에, 이 방법은 최적의 1차 수준 방법과 유사한 반복 복잡도를 갖는 전역 수렴을 달성하며, 수치 결과는 이론적 경계가 정확한 대응 항목보다 열 劣함에도 불구하고 비정확한 Hessian이 실용적 성능을 크게 향상시킬 수 있음을 보여준다.

ABSTRACT

In this paper, we generalize (accelerated) Newton's method with cubic regularization under inexact second-order information for (strongly) convex optimization problems. Under mild assumptions, we provide global rate of convergence of these methods and show the explicit dependence of the rate of convergence on the problem parameters. While the complexity bounds of our presented algorithms are theoretically worse than those of their exact counterparts, they are at least as good as those of the optimal first-order methods. Our numerical experiments also show that using inexact Hessians can significantly speed up the algorithms in practice.

연구 동기 및 목표

  • 뉴턴 유형 방법에서 정확한 Hessian 계산의 높은 계산 비용을 줄이는 효율적인 2차 수준 최적화 방법을 개발하기 위해.
  • 복합 정규화를 통한 가속 뉴턴 방법을 정확한 Hessian 정보가 없는 설정으로 일반화하기 위해.
  • Hessian 근사 오차와 Hessian의 매끄러움에 대한 온건한 가정 하에 전역 수렴 속도를 확립하기 위해.
  • 비정확한 Hessian 근사가 이론적 복잡도 경계가 정확한 방법보다 열 劣함에도 불구하고 실용적으로 더 빠른 수렴을 이끌 수 있는지 보여주기 위해.
  • 비정확한 2차 정보 하에서 (강한) 볼록 문제에 대해 반복 복잡도와 수렴 속도에 대한 이론적 보장을 제공하기 위해.

제안 방법

  • 이 방법은 다음 형태의 하위문제를 사용한다: f(x_k) + ⟨∇f(x_k), x−x_k⟩ + ½⟨H_k(x−x_k), x−x_k⟩ + (η/6)‖x−x_k‖³을 최소화하며, 여기서 H_k는 비정확한 Hessian 근사이다.
  • Hessian 근사가 진짜 Hessian에서의 최대 편차를 나타내는 μ_u와 반복점에서 최적 해까지의 거리를 나타내는 R이라는 오차 범위를 만족한다고 가정한다.
  • Hessian의 γ-립시츠 연속성이라는 가정 하에 Hessian의 매끄러움을 보장한다.
  • 복합 정규화와 비정확한 Hessian 정보의 조합을 통해 수렴 속도를 유도하며, μ_u, R, γ, ε에 명시적인 의존성을 가진다.
  • 네스테로프 스타일의 모멘텀을 통해 가속화를 달성하여, 강한 볼록 문제에 대해 향상된 수렴 속도를 얻는다.
  • 하위문제는 고정밀도로 랑츠 방법을 사용하여 해결하며, 계산 비용을 줄이기 위해 Hessian 근사는 부분표본 추출을 통해 계산한다.

실험 결과

연구 질문

  • RQ1복합 정규화 뉴턴 방법을 비정확한 Hessian 근사와 함께 사용하면서도 전역 수렴을 유지할 수 있는가?
  • RQ2제한된 Hessian 근사 오차 하에서 비정확한 복합 정규화 뉴턴 방법의 이론적 수렴 속도는 무엇인가?
  • RQ3실제로 비정확한 방법과 정확한 대응 항목, 최적의 1차 수준 방법 간의 성능는 어떻게 비교되는가?
  • RQ4부분표본 Hessian 근사를 사용함으로써 이론적 복잡도 경계가 열 劣함에도 불구하고 수렴 속도가 빨라지는가?
  • RQ5반복 횟수와 런타임 측면에서 Hessian 근사에 대한 최적의 부분표본 크기는 무엇인가?

주요 결과

  • 볼록 문제에서 ε-해를 얻기 위한 총 반복 수는 O(μ_u R² / ε + √(γ R³ / ε))로 유계이며, 이는 최적의 1차 수준 방법과 동일한 복잡도를 가진다.
  • 강한 볼록 문제에 대해, 복합 정규화를 통한 가속 비정확 뉴턴 방법은 표준 1차 수준 방법보다 더 빠른 수렴 속도를 달성한다.
  • 이진 분류 문제에 대한 수치 실험 결과, |S_H| = 0.005m 부분표본을 사용한 비정확한 Hessian이 Mushrooms 및 Gisette 데이터셋 양쪽에서 가장 우수한 런타임 성능를 보였다.
  • 두 데이터셋 모두에서 INCR 방법은 가속 경사 하강법(AG)보다 반복 횟수와 CPU 시간 측면에서 훨씬 더 빠른 수렴을 보였다.
  • AINCR 및 다단계 AINCR 변형은 반복 횟수 측면에서 INCR를 초월하며, 유사하거나 略적으로 더 나은 런타임 성능를 기록하여 비정확한 Hessian 정보와의 가속화의 이점을 보여주었다.
  • 이론적 경계는 더 큰 부분표본 크기가 정확도를 향상시킬 것이라 추론하지만, 실용적 성능가 가장 높은 결과는 상대적으로 작은 부분표본 크기(0.005m)에서 달성되었으며, 이는 너무 정확한 Hessian 근사가 효율성을 향상시키지 못할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.