Skip to main content
QUICK REVIEW

[논문 리뷰] Zeroth-order Nonconvex Stochastic Optimization: Handling Constraints, High-Dimensionality and Saddle-Points

Krishnakumar Balasubramanian, Saeed Ghadimi|arXiv (Cornell University)|2018. 09. 17.
Stochastic Gradient Optimization Techniques인용 수 6
한 줄 요약

이 논문은 함수 평가 이외의 정보를 사용하지 않고, 비볼록 문제에 대해 약한 조건, 고차원성, 안장점 회피를 고려한 제로오더 확률적 최적화 알고리즘을 제안한다. 함수 평가만을 사용하여 제약 조건이 있는 최적화를 위한 제로오더 조건부 기울기 하강법, 차원에 대해 다항로그적 의존도를 가지는 잘린 확률적 기울기 방법, 그리고 이차 스틴의 항법을 통한 새로운 헤시안 추정기법을 도입하여, $\tilde{\rm O}(d/\rho^{7/2})$의 오рак루 복잡도를 달성하는 삼차 정규화 뉴턴 방법을 제안한다. 이는 $\rho$-정확도를 가진 이차 정류점에 도달하는 데에 사용된다.

ABSTRACT

In this paper, we propose and analyze zeroth-order stochastic approximation algorithms for nonconvex and convex optimization, with a focus on addressing constrained optimization, high-dimensional setting and saddle-point avoiding. To handle constrained optimization, we first propose generalizations of the conditional gradient algorithm achieving rates similar to the standard stochastic gradient algorithm using only zeroth-order information. To facilitate zeroth-order optimization in high-dimensions, we explore the advantages of structural sparsity assumptions. Specifically, (i) we highlight an implicit regularization phenomenon where the standard stochastic gradient algorithm with zeroth-order information adapts to the sparsity of the problem at hand by just varying the step-size and (ii) propose a truncated stochastic gradient algorithm with zeroth-order information, whose rate of convergence depends only poly-logarithmically on the dimensionality. We next focus on avoiding saddle-points in non-convex setting. Towards that, we interpret the Gaussian smoothing technique for estimating gradient based on zeroth-order information as an instantiation of first-order Stein's identity. Based on this, we provide a novel linear-(in dimension) time estimator of the Hessian matrix of a function using only zeroth-order information, which is based on second-order Stein's identity. We then provide an algorithm for avoiding saddle-points, which is based on a zeroth-order cubic regularization Newton's method and discuss its convergence rates.

연구 동기 및 목표

  • 비볼록, 제약 조건이 있는, 고차원 문제에 대해 제로오더 최적화의 이론적 보장을 부족하게 하는 문제를 해결한다.
  • 기울기 또는 헤시안 정보에 대한 액세스가 제한된 상황에서도 일阶 최적화 수렴 속도에 도달하거나 이를 근접하는 제로오더 알고리즘을 개발한다.
  • 함수 평가만을 사용하여 고차원 환경에서의 구조적 희소성과 안장점을 피하는 효율적인 최적화를 가능하게 한다.
  • 이차 스틴의 항법을 통한 제로오더 헤시안 추정을 통해 이차 정류점에 대한 수렴 속도를 제공한다.
  • 고차원 최적화에서 제약 조건 기하학, 희소성, 제로오더 정보 간의 상호작용을 탐색한다.

제안 방법

  • 제약 조건이 있는 최적화를 위한 제로오더 조건부 기울기 하강법을 제안하여, 제로오더 정보 하에서 확률적 기울기 하강법과 유사한 수렴 속도를 달성한다.
  • 차원에 대해 다항로그적 의존도를 가지는 제로오더 정보를 사용하는 잘린 확률적 기울기 방법을 도입하여, 기존 제로오더 방법의 선형 의존도를 개선한다.
  • 스텝 사이즈를 변화시킴으로써 명시적인 희소성 유도 펜alties 없이도, 제로오더 기울기 하강법에서 암묵적 정규화 효과를 관찰한다.
  • 이차 스틴의 항법을 이용하여 차원에 대해 선형적인 헤시안 추정기법을 유도하여, 오직 함수 쿼리로부터의 효율적 헤시안 근사화를 가능하게 한다.
  • 헤시안 추정기법을 활용하여 안장점을 피하는 제로오더 삼차 정규화 뉴턴 방법을 설계한다. 이는 이차 정류점에 도달하는 데에 기여한다.
  • 가우시안 스무스닝을 일阶 스틴의 항법의 특수한 경우로 사용하여 기울기 추정을 정당화하고, 이를 이차 스틴의 항법을 통해 헤시안 추정으로 확장한다.

실험 결과

연구 질문

  • RQ1제약 조건이 있는 최적화에서, 제로오더 정보만을 사용할 경우 조건부 기울기 방법이 확률적 기울기 하강법과 유사한 수렴 속도를 달성할 수 있는가?
  • RQ2고차원에서의 제로오더 최적화는 구조적 희소성을 활용하여 효율화될 수 있으며, 이 경우 스텝 사이즈 선택은 어떤 역할을 하는가?
  • RQ3비볼록 최적화에서 안장점을 피하기 위해 제로오더 쿼리로부터 이차 정보를 어떻게 추정할 수 있는가?
  • RQ4비볼록 확률적 최적화에서 오직 함수 평가만을 사용하여 이차 정류점에 도달하는 데에 필요한 오라클 복잡도는 얼마인가?
  • RQ5제약 조건 기하학, 희소성, 제로오더 정보 간의 상호작용은 고차원 환경에서 수렴 속도 향상에 기여할 수 있는가?

주요 결과

  • 제로오더 조건부 기울기 하강법은 차원에 대해 선형 복잡도를 가지며, 함수 쿼리만을 사용하여도 효율적인 제약 조건 최적화를 달성하며, 확률적 기울기 하강법과 유사한 수렴 속도를 보인다.
  • 제로오더 정보를 사용하는 잘린 확률적 기울기 방법은 차원에 대해 다항로그적 요소에만 의존하는 수렴 속도를 달성하여, 기존 표준 방법의 선형 의존도에 비해 크게 향상된다.
  • 제로오더 기울기 하강법에서는 암묵적 정규화 효과가 관찰되며, 이는 스텝 사이즈 조정을 통해 희소성이 자동으로 포착되며, 명시적인 희소성 유도 펜alties 없이도 가능하다.
  • 이차 스틴의 항법을 기반으로 한 새로운 헤시안 추정기법은 오직 함수 평가만을 사용하여 차원에 대해 선형적인 헤시안 근사화를 가능하게 하여, 이차 최적화 방법의 기초를 마련한다.
  • 제안된 제로오더 삼차 정규화 뉴턴 방법은 $\tilde{\rm O}(d/\rho^{7/2})$의 오라클 복잡도를 달성하여 $\rho$-정확도를 가진 이차 정류점에 도달하며, 헤시안 추정에 대해 총 샘플 복잡도는 $\tilde{\rm O}(d^4/\rho^{5/2})$이다.
  • 제로오더 오라클 호출 총 수는 $\tilde{\rm O}(d/\rho^{7/2})$로 스케일링되며, 이는 비볼록 문제에서 고정밀도 수렴을 달성하기 위해 이차 정보를 사용하는 데서 유리함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.