Skip to main content
QUICK REVIEW

[논문 리뷰] Regret minimization in stochastic non-convex learning via a proximal-gradient approach

Nadav Hallak, Panayotis Mertikopoulos|arXiv (Cornell University)|2020. 10. 13.
Advanced Bandit Algorithms Research참고 문헌 34인용 수 7
한 줄 요약

이 논문은 제약 조건과 정규화 하에 1차 오ракูล 피드백을 사용하여 확률적 비볼록 최적화를 위한 프록스-그래디언트 방법을 제안하며, 국소적 손실 최소화를 달성한다. 이는 최소-최대 순서 최적의 손실 경계를 확립하고, 분산 감소 기법과 동일한 복잡도 보장을 갖는 새로운 프록스-그래디언트 방식을 통해 온라인 및 오프라인 비볼록 확률적 최적화를 연결한다.

ABSTRACT

Motivated by applications in machine learning and operations research, we study regret minimization with stochastic first-order oracle feedback in online constrained, and possibly non-smooth, non-convex problems. In this setting, the minimization of external regret is beyond reach for first-order methods, so we focus on a local regret measure defined via a proximal-gradient mapping. To achieve no (local) regret in this setting, we develop a prox-grad method based on stochastic first-order feedback, and a simpler method for when access to a perfect first-order oracle is possible. Both methods are min-max order-optimal, and we also establish a bound on the number of prox-grad queries these methods require. As an important application of our results, we also obtain a link between online and offline non-convex stochastic optimization manifested as a new prox-grad scheme with complexity guarantees matching those obtained via variance reduction techniques.

연구 동기 및 목표

  • 온라인, 제약 조건이 있는, 비스무스한, 비볼록 최적화 문제에서 확률적 1차 오라클 피드백을 통한 손실 최소화 문제에 대응하는 것.
  • 이 설정에서 국소적 손실 최소화를 달성하는 프록스-그래디언트 알고리즘을 개발하는 것. 이는 프록시멀-그래디언트 매핑을 통해 정의된다.
  • 확률적 피드백과 제약 조건 하에서 제안된 방법의 최소-최대 순서 최적성(정확도)을 확립하는 것.
  • 필요한 확률적 1차 오라클(SFO) 쿼리 수의 복잡도 경계를 유도하는 것.
  • 같은 복잡도 보장을 갖는 프록스-그래디언트 방식을 통해 온라인 및 오프라인 비볼록 확률적 최적화 간의 새로운 연결 고리를 수립하는 것.

제안 방법

  • 논문은 확률적 1차 피드백 기반의 프록스-그래디언트 방법을 제안하며, 크기 $ w $ 의 슬라이딩 윈도우를 사용해 국소적 손실 측정 기준을 정의한다.
  • 비스무스성과 제약 조건을 다루기 위해 프록시멀-그래디언트 매핑을 도입하고, 내부 루프 반복에 내림내림 보조 정리(Descent Lemma)를 적용한다.
  • 내부 루프에서 그라디언트와 스텝 사이즈 조건에 기반한 정지 기준을 사용하여 목적 함수의 충분한 감소를 보장한다.
  • 이 방법은 리프시츠 스무쓰니스, 유한한 그라디언트, 그리고 확률적 그라디언트의 유한한 분산을 가정하에 분석된다.
  • 핵심 요소로는 국소적 손실 비교자 정의를 위한 슬라이딩 윈도우 평균 $ S_{t,w}({f x}) $ 의 사용이며, 이는 국소적 최적성 추적을 가능하게 한다.
  • 예상 제곱 노름에 대한 경계를 도출하기 위해 얀의 부등식과 내림내림 보조 정리를 사용하여 프록시멀 그라디언트의 기대 제곱 노름에 대한 경계를 유도한다.

실험 결과

연구 질문

  • RQ1확률적 1차 오라클 피드백을 통한 온라인, 제약 조건이 있는, 비스무스한, 비볼록 최적화에서 국소적 손실 최소화를 달성할 수 있는가?
  • RQ2제안된 프록스-그래디언트 방법은 손실과 SFO 쿼리 복잡도 측면에서 최소-최대 순서 최적인가?
  • RQ3온라인 국소적 손실 최소화 프레임워크는 유사한 복잡도 보장을 갖는 오프라인 비볼록 확률적 최적화와 연결될 수 있는가?
  • RQ4$ au $ 가 반복 횟수일 때, $ ilde{O}( au) $ 복잡도를 달성하기 위해 필요한 확률적 1차 오라클 호출 수는 얼마인가?
  • RQ5확률적 설정에서 유한한 분산과 리프시츠 스무쓰니스 가정 하에서 이 방법은 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 프록스-그래디언트 방법은 $ Oig(( au^2 + au)/w^2ig) $ 의 국소적 손실 경계를 달성하며, 이는 최소-최대 순서 최적이다.
  • 프록시멀 그라디언트의 기대 제곱 노름은 $ rac{2}{(T-w)w^2}ig(( au^2 + au)T + 6V_w[T]ig) $ 이하로 경계되며, 정류점 수렴을 보장한다.
  • 확률적 1차 오라클(SFO) 호출 수는 $ O(M au ho^{-3/2}) $ 이하로 경계되며, 여기서 $ ho $ 는 원하는 정확도이고 $ M $ 은 문제 매개변수이다.
  • 이 방법은 오프라인 비볼록 확률적 최적화에서 분산 감소 기법과 동일한 복잡도 보장을 달성한다.
  • SFO 호출 수의 경계는 내부 루프에서의 내림내림 추론을 통해 유도되며, 외부 반복마다 약 $ O(w) $ 번의 호출이 필요하다는 것을 보여준다.
  • 분석을 통해 이 방법은 확률적 그라디언트에 대해 강건하며, 약한 정규성 조건 하에서도 하향하는 손실을 유지함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.