[논문 리뷰] Stochastic Second-order Methods for Non-convex Optimization with Inexact Hessian and Gradient
이 논문은 고정 샘플 크기를 사용하는 고정 샘플 확률적 근사법을 활용해 비볼록 최적화 문제에서 근사된 기울기와 헤시안 행렬을 다루는 확률적 신뢰 영역(STR) 및 확률적 삼차 정규화(SARC) 방법을 제안한다. 두 방법 모두 근사된 기울기와 헤시안 행렬이 존재하더라도 온건한 근사 오차 조건 하에서 $\epsilon$-근사된 이阶 최적성에 도달하기 위한 반복 복잡도가 정확한 대응 방법과 동일한 것으로 입증되었으며, 딥 러닝 작업에서 성능을 검증하였다.
Trust region and cubic regularization methods have demonstrated good performance in small scale non-convex optimization, showing the ability to escape from saddle points. Each iteration of these methods involves computation of gradient, Hessian and function value in order to obtain the search direction and adjust the radius or cubic regularization parameter. However, exactly computing those quantities are too expensive in large-scale problems such as training deep networks. In this paper, we study a family of stochastic trust region and cubic regularization methods when gradient, Hessian and function values are computed inexactly, and show the iteration complexity to achieve $ε$-approximate second-order optimality is in the same order with previous work for which gradient and function values are computed exactly. The mild conditions on inexactness can be achieved in finite-sum minimization using random sampling. We show the algorithm performs well on training convolutional neural networks compared with previous second-order methods.
연구 동기 및 목표
- 대규모 비볼록 최적화 문제에서 근사된 기울기와 헤시안 행렬 추정치를 다룰 수 있는 실용적인 확률적 이阶 최적화 방법을 개발하는 것.
- 근사된 헤시안 행렬과 기울기 근사치 하에서 STR 및 SARC의 수렴성과 반복 복잡도를 이론적으로 분석하는 것.
- 기울기, 헤시안 행렬, 함수 값 계산에서의 근사 오차가 존재하더라도 반복 복잡도가 정확한 방법과 동일한 순서를 유지함을 보이는 것.
- 하나의 하향적 함수 값 샘플링을 통해 신뢰 영역 반경과 정규화 파라미터를 자동 조정할 수 있도록 하는 것.
- 딥 컨volution 신경망 학습에서 제안된 방법의 실험적 검증을 통해 런타임 성능 향상을 보여주는 것.
제안 방법
- 고정 크기 샘플링을 통해 근사된 기울기와 헤시안 행렬을 사용하는 확률적 신뢰 영역(STR) 및 확률적 삼차 정규화(SARC) 방법을 적용한다.
- 근사된 $ g(x_k) $와 $ B(x_k) $를 사용하는 이차 모델 $ m_k(s) = f(x_k) + \langle g(x_k), s \rangle + \frac{1}{2} \langle s, B(x_k)s \rangle $를 적용하며, 오차는 유한하고 고정되어 있음을 가정한다.
- 연산자-버니에르 부등식을 활용해 하향 샘플링된 함수 값을 근사함으로써, 신뢰 영역 반경과 삼차 정규화 파라미터의 자동 조정이 가능하도록 한다.
- 기울기, 헤시안 행렬, 함수 값이 모두 근사된 상황에서도, 하향 샘플링된 목적 함수 값에 기반해 신뢰 영역 반경과 정규화 파라미터를 적응적으로 갱신하는 방법을 도입한다.
- 부정확성 하에서 성공 확률과 수렴 속도를 균일한 분석 프레임워크로 제한하기 위해, 부드러움과 유한한 헤시안 변동성에 대한 가정을 활용한다.
- 근사된 기울기 노름과 근사된 헤시안 행렬의 최소 고유값을 기반으로 종료 기준을 설정하여 이阶 최적성 보장
실험 결과
연구 질문
- RQ1기울기와 헤시안 행렬이 모두 근사된 경우, 확률적 이阶 최적화 방법이 정확한 방법과 동일한 반복 복잡도를 유지할 수 있는가?
- RQ2기울기, 헤시안 행렬, 함수 값의 근사 오차에 대해 어떤 조건이 존재할 경우, 확률적 신뢰 영역 및 삼차 정규화 방법이 $\epsilon$-근사된 이阶 최적성으로 수렴하는가?
- RQ3기울기와 헤시안 행렬이 근사된 상황에서, 기울기와 헤시안 행렬의 근사 오차가 존재하더라도 하향 샘플링된 함수 값만을 사용해 신뢰 영역 반경과 삼차 정규화 파라미터를 적응적으로 조정할 수 있는가?
- RQ4딥 러닝 작업에서 제안된 STR 및 SARC 방법이 기존의 확률적 이阶 최적화 방법에 비해 수렴 속도와 학습 시간 측면에서 실제로 어떻게 성능을 내는가?
- RQ5고정 샘플 기반의 기울기와 헤시안 행렬 근사치를 사용하는 확률적 이阶 최적화 방법에 대해 이론적 수렴 보장을 확보할 수 있는가?
주요 결과
- STR 및 SARC의 반복 복잡도는 $\mathcal{O}(\max\{(\varepsilon_{\nabla f}-\varepsilon_g)^{-2}, (\varepsilon_H - \varepsilon_B)^{-3}\})$이며, 온건한 근사 오차 조건 하에서 정확한 방법과 동일한 복잡도를 갖는다.
- SARC의 경우 종료 기준이 충족될 때 반복 복잡도가 $\mathcal{O}(\max\{(\varepsilon_{\nabla f}-\varepsilon_g)^{-3/2}, (\varepsilon_H - \varepsilon_B)^{-3}\})$로 향상되며, 이는 STR보다 더 우수한 성능이다.
- 고정된 유한한 근사 오차를 갖는 고정 샘플 확률적 근사법을 사용함으로써, 기울기, 헤시안 행렬, 함수 값이 모두 근사된 상황에서도 $\epsilon$-근사된 이阶 최적성으로 수렴함을 입증하였다.
- 연산자-버니에르 부등식의 활용은 신뢰 영역 반경과 정규화 파라미터의 안정적인 하향 샘플링을 가능하게 하여 자동이고 적응적인 조정이 가능하도록 하였다.
- VGG 네트워크를 사용한 CIFAR-10 실험 결과, 제안된 STR 및 SARC 방법이 기존의 신뢰 영역 및 삼차 정규화 방법보다 런타임 측면에서 더 빠른 성능을 보였다.
- 기존 연구([7])에서 기울기 근사 오차를 허용하지 않았고, [8]에서는 더 엄격한 근사 오차 조건을 요구했지만, 본 연구는 더 넓은 조건 하에서도 최적의 복잡도를 유지함으로써 기존 연구를 확장하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.