Skip to main content
QUICK REVIEW

[논문 리뷰] Nonconvex Zeroth-Order Stochastic ADMM Methods with Lower Function Query Complexity

Feihu Huang, Shangqian Gao|arXiv (Cornell University)|2019. 07. 30.
Stochastic Gradient Optimization Techniques참고 문헌 45인용 수 5
한 줄 요약

이 논문은 유한합 및 온라인 최적화 문제에 대해 다중 비스무스 페널티를 갖는 비볼록 문제를 해결하기 위한 새로운 비볼록 제로스텝 스토하스틱 ADMM 방법인 ZO-SPIDER-ADMM와 ZOO-ADMM+를 제안한다. 분산 감소된 기울기 추정과 좌표별 스무딩을 활용하여, 각각 $O(nd + dn^{1/2}\epsilon^{-1})$ 및 $O(d\epsilon^{-3/2})$의 향상된 함수 쿼리 복잡도를 달성하며, 이는 이전 작업 대비 $O(d^{1/3}n^{1/6})$ 및 $O(\rho^{-1/2})$의 요인으로 향상된다. 블랙박스 적대적 공격에 대한 검증을 통해 효율성과 낮은 쿼리 비용을 입증한다.

ABSTRACT

Zeroth-order (a.k.a, derivative-free) methods are a class of effective optimization methods for solving complex machine learning problems, where gradients of the objective functions are not available or computationally prohibitive. Recently, although many zeroth-order methods have been developed, these approaches still have two main drawbacks: 1) high function query complexity; 2) not being well suitable for solving the problems with complex penalties and constraints. To address these challenging drawbacks, in this paper, we propose a class of faster zeroth-order stochastic alternating direction method of multipliers (ADMM) methods (ZO-SPIDER-ADMM) to solve the nonconvex finite-sum problems with multiple nonsmooth penalties. Moreover, we prove that the ZO-SPIDER-ADMM methods can achieve a lower function query complexity of $O(nd+dn^{\frac{1}{2}}ε^{-1})$ for finding an $ε$-stationary point, which improves the existing best nonconvex zeroth-order ADMM methods by a factor of $O(d^{\frac{1}{3}}n^{\frac{1}{6}})$, where $n$ and $d$ denote the sample size and data dimension, respectively. At the same time, we propose a class of faster zeroth-order online ADMM methods (ZOO-ADMM+) to solve the nonconvex online problems with multiple nonsmooth penalties. We also prove that the proposed ZOO-ADMM+ methods achieve a lower function query complexity of $O(dε^{-\frac{3}{2}})$, which improves the existing best result by a factor of $O(ε^{-\frac{1}{2}})$. Extensive experimental results on the structure adversarial attack on black-box deep neural networks demonstrate the efficiency of our new algorithms.

연구 동기 및 목표

  • 비볼록 설정에서 복잡한 비스무스 페널티를 갖는 기존 제로스텝 ADMM 방법의 높은 함수 쿼리 복잡도와 적용 범위의 제한을 해결한다.
  • 유한합 및 온라인 최적화에 적합한 더 빠른 제로스텝 스토하스틱 ADMM 알고리즘을 개발한다.
  • 비볼록 문제에서 $\epsilon$-정류점(\epsilon$-stationary point)을 찾는 데 있어 더 낮은 함수 쿼리 복잡도로 향상된 이론적 수렴 속도를 달성한다.
  • 딥 네URAL 네트워크에 대한 블랙박스 적대적 공격을 효율적으로 수행하기 위해 필요한 함수 쿼리 수를 줄인다.

제안 방법

  • 유한합 문제를 위한 ZO-SPIDER-ADMM를 제안하며, 좌표별 기울기 추정기(CooGE)와 SPIDER 프레임워크를 통한 분산 감소 기법을 활용하여 기울기 추정 오차를 감소시킨다.
  • ADMM 프레임워크에 스토하스틱 경로 통합 미분 추정(SARAH/SPIDER)을 통합하여, 비볼록 유한합 최적화에서 더 낮은 함수 쿼리 복잡도를 달성한다.
  • 유사한 분산 감소 기법을 활용하여 온라인 비볼록 문제를 위한 ZOO-ADMM+를 설계함으로써 더 빠른 수렴과 낮은 쿼리 비용을 실현한다.
  • 기울기 접근이 불가능한 상황에서 정확도를 향상시키기 위해 가우시안 및 균일 스무딩 기울기 추정기(GauGE, UniGE)와 함께 좌표별 추정 기법(CooGE)을 활용한다.
  • 수렴성과 안정성을 균형 잡기 위해 하이브리드 단계 크기 및 페널티 파라미터 전략을 사용하며, $\eta = \frac{\alpha\sigma_{\min}(G)}{4L}$ 및 $\rho = \frac{2\sqrt{237}\kappa_GL}{\sigma^{A}_{\min}\alpha}$로 설정한다.
  • 기대 하위기울기 노름과 제약 위반을 기반으로 한 이론적 분석을 통해 KKT 점과의 거리를 유한하게 제한함으로써 $\epsilon$-정류점 해로의 수렴을 보장한다.

실험 결과

연구 질문

  • RQ1제로스텝 ADMM 방법은 다중 비스무스 페널티를 갖는 비볼록 유한합 문제에서 더 낮은 함수 쿼리 복잡도를 달성할 수 있는가?
  • RQ2SPIDER 스타일 추정을 통한 분산 감소는 유도 없는 최적화에서 제로스텝 ADMM의 수렴을 어떻게 향상시키는가?
  • RQ3기존 방법보다 더 낮은 쿼리 복잡도를 보장하는 온라인 제로스텝 ADMM 방법을 설계할 수 있는가?
  • RQ4이들 방법은 딥 네URAL 네트워크에 대한 블랙박스 적대적 공격에서 함수 쿼리 수를 얼마나 줄일 수 있는가?

주요 결과

  • ZO-SPIDER-ADMM 방법은 비볼록 유한합 문제에서 $\epsilon$-정류점(\epsilon$-stationary point)을 찾는 데 함수 쿼리 복잡도 $O(nd + dn^{1/2}\epsilon^{-1})$을 달성하며, 이는 이전 방법 대비 $O(d^{1/3}n^{1/6})$의 요인으로 향상된다.
  • ZOO-ADMM+ 방법은 온라인 비볼록 문제에서 함수 쿼리 복잡도 $O(d\epsilon^{-3/2})$를 달성하며, 기존 최고 성능 결과 대비 $O(\epsilon^{-1/2})$의 요인으로 향상된다.
  • 이론적 분석을 통해 기대 하위기울기 노름과 제약 위반이 $O(1/K) + O(d^2\nu^2) + O(d\mu^2) + O(1/b_1)$로 수렴함을 확인하였으며, 이는 $\epsilon$-정류점 해로의 수렴을 보장한다.
  • 제안된 방법은 블랙박스 적대적 공격에 대한 실험적 검증을 통해 기존 제로스텝 방법 대비 뛰어난 효율성과 낮은 쿼리 비용을 입증하였다.
  • 적절한 단계 크기와 페널티 파라미터 균형 조절을 통해 비볼록 및 비스무스 설정에서도 안정성과 수렴성을 유지한다.
  • 분석 결과, $\beta_{\max}$, $\gamma$, $\vartheta_1, \vartheta_2$와 같은 핵심 파라미터들이 $n$과 $K$에 독립적으로 유계임을 확인하였으며, 이는 확장성 보장을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.