Skip to main content
QUICK REVIEW

[논문 리뷰] A Stochastic Extra-Step Quasi-Newton Method for Nonsmooth Nonconvex Optimization

Minghan Yang, Andre Milzarek|arXiv (Cornell University)|2019. 10. 21.
Sparse and Compressive Sensing Techniques참고 문헌 122인용 수 6
한 줄 요약

이 논문은 비연속 비볼록 최적화를 위한 확률적 추가단계 준뉴턴 방법을 제안하며, 확률적 고차원 단계와 추가적인 프록시멀 그라디언트 단계를 결합하여 기대값 기준 정류점으로의 전역 수렴을 보장한다. 이 방법은 $Ó(N^{2/3}/ε)$의 인크리멘탈 일阶 오라클 복잡도를 달성하여, 대규모 로지스틱 회귀 및 딥러닝 작업에서 기존의 일계수 방법보다 뛰어난 성능을 보인다.

ABSTRACT

In this paper, a novel stochastic extra-step quasi-Newton method is developed to solve a class of nonsmooth nonconvex composite optimization problems. We assume that the gradient of the smooth part of the objective function can only be approximated by stochastic oracles. The proposed method combines general stochastic higher order steps derived from an underlying proximal type fixed-point equation with additional stochastic proximal gradient steps to guarantee convergence. Based on suitable bounds on the step sizes, we establish global convergence to stationary points in expectation and an extension of the approach using variance reduction techniques is discussed. Motivated by large-scale and big data applications, we investigate a stochastic coordinate-type quasi-Newton scheme that allows to generate cheap and tractable stochastic higher order directions. Finally, the proposed algorithm is tested on large-scale logistic regression and deep learning problems and it is shown that it compares favorably with other state-of-the-art methods.

연구 동기 및 목표

  • 완전한 그라디언트 평가가 높은 계산 비용으로 인해 비현실적인 대규모 데이터 최적화 문제를 다루기 위해.
  • 스토케스틱 근사 하에서 전역 수렴을 보장하면서도 고차원 정보를 통합하는 확률적 준뉴턴 방법을 개발하기 위해.
  • 라인 서치나 백트랙킹을 요구하지 않고도 수렴을 안정화하기 위해 추가 프록시멀 그라디언트 단계를 사용하는 방법을 설계하기 위해.
  • 확률적 고차원 방향을 활용하여 일계수 방법보다 향상된 수렴 복잡도를 달성하기 위해.
  • 희소 로지스틱 회귀 및 딥러닝과 같은 실용적 문제들에서 방법의 효과성을 입증하기 위해.

제안 방법

  • 이 방법은 $f$가 부드럽지만 스토케스틱 오라클을 통해만 접근 가능한 형태의 복합 비볼록 문제 $\min_x f(x) + \varphi(x)$를 해결한다.
  • 최적성 조건을 정의하기 위해 프록시멀 타입의 고정점 방정식 $F^\Lambda(x) = x - \mathrm{prox}^\Lambda_\varphi(x - \Lambda^{-1}\nabla f(x)) = 0$을 사용한다.
  • 이 고정점 방정식을 스토케스틱 오라클로부터의 근사 그라디언트를 사용하여 풀어 확률적 고차원 단계를 도출한다.
  • 전역 수렴을 보장하고 반복값을 안정화하기 위해 추가적인 스토케스틱 프록시멀 그라디언트 단계를 도입한다.
  • 스토케스틱 오차와 수렴 간의 균형을 맞추기 위한 스텝 사이즈 규칙을 사용하며, 특정 합계 조건을 만족한다.
  • 효율성과 안정성을 향상시키기 위해 분산 감소 기법과 서브샘플링 기법을 프레임워크에 통합한다.

실험 결과

연구 질문

  • RQ1스토케스틱 그라디언트 접근만 가능할 때, 고차원 단계를 포함한 확률적 준뉴턴 방법이 비연속 비볼록 환경에서 전역 수렴을 달성할 수 있는가?
  • RQ2라인 서치나 백트랙킹 없이 추가 프록시멀 그라디언트 단계가 수렴을 어떻게 안정화할 수 있는가?
  • RQ3이러한 방법의 인크리멘탈 일계오라클(Implicit First-Order Oracle, IFO) 복잡도는 얼마이며, 일계수 방법과 비교해 볼 때 어떻게 되는가?
  • RQ4대규모 문제에 대해 좌표 기반 업데이트를 사용하여 효율적으로 구현할 수 있는가?
  • RQ5스토케스틱 고차원 정보의 통합이 딥러닝 및 희소 로지스틱 회귀 작업에서 성능 향상에 기여하는가?

주요 결과

  • 제안된 방법은 기대값 기준으로 정류점으로의 전역 수렴을 달성하며, $\mathbb{E}[\|F^I(\mathbf{X}^k)\|^2] \to 0$ 이다. $k \to \infty$ 일 때.
  • ε-정확도의 정류점에 도달하기 위한 IFO 복잡도는 $\mathcal{O}(N^{2/3}/\varepsilon)$이며, 이는 표준 일계수 방법보다 우수하다.
  • 대규모 로지스틱 회귀 및 딥러닝 벤치마크에서 최첨단 일계수 방법과 비교해 유사한 성능을 달성한다.
  • 분산 감소 기법과 스토케스틱 고차원 방향의 사용은 더 빠른 수렴과 향상된 강인성을 이끌어낸다.
  • 좌표 기반 준뉴턴 방식은 대규모 문제에 적합한 저비용이고 실현 가능한 탐색 방향을 가능하게 한다.
  • 이론적 분석은 추가 단계가 라인 서치 없이도 목적 함수 값의 근사 감소를 보장함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.