Skip to main content
QUICK REVIEW

[논문 리뷰] Boosting One-Point Derivative-Free Online Optimization via Residual Feedback

Yan Zhang, Yi Zhou|arXiv (Cornell University)|2020. 10. 14.
Advanced Bandit Algorithms Research참고 문헌 27인용 수 7
한 줄 요약

이 논문은 훨씬 낮은 분산을 갖는 기울기 추정을 위해 잔차 피드백을 사용하는 새로운 일점 유도 없는 온라인 최적화 방법을 제안한다. 연속적인 함수 평가치의 차이를 활용하여, 더 약한 가정 하에 볼록 및 비볼록 문제 모두에서 더 날카운 감소한 위험 한계를 달성한다. 이는 이론적·실제로 기존의 일점 방법보다 뛰어난 성능을 발휘한다.

ABSTRACT

Zeroth-order optimization (ZO) typically relies on two-point feedback to estimate the unknown gradient of the objective function. Nevertheless, two-point feedback can not be used for online optimization of time-varying objective functions, where only a single query of the function value is possible at each time step. In this work, we propose a new one-point feedback method for online optimization that estimates the objective function gradient using the residual between two feedback points at consecutive time instants. Moreover, we develop regret bounds for ZO with residual feedback for both convex and nonconvex online optimization problems. Specifically, for both deterministic and stochastic problems and for both Lipschitz and smooth objective functions, we show that using residual feedback can produce gradient estimates with much smaller variance compared to conventional one-point feedback methods. As a result, our regret bounds are much tighter compared to existing regret bounds for ZO with conventional one-point feedback, which suggests that ZO with residual feedback can better track the optimizer of online optimization problems. Additionally, our regret bounds rely on weaker assumptions than those used in conventional one-point feedback methods. Numerical experiments show that ZO with residual feedback significantly outperforms existing one-point feedback methods also in practice.

연구 동기 및 목표

  • 각 시간 단계에서 단일 함수 평가만 가능한 기존 일점 피드백의 한계를 해결한다.
  • 온라인 및 비정상적인 환경에서 성능을 떨어뜨리는 표준 일점 기울기 추정기의 높은 분산을 극복한다.
  • 기존 연구보다 더 약한 가정 하에 영차수 온라인 최적화의 더 날카운 위험 한계를 개발한다.
  • 적대적 및 비정상적인 환경에서 시간에 따라 변화하는 최적화자를 효과적으로 추적할 수 있도록 한다.
  • 비볼록 온라인 최적화 문제에 대한 일점 ZO 방법의 이론적 분석을 처음으로 제공한다.

제안 방법

  • 두 연속적인 피드백 포인트 간의 잔차를 사용하는 새로운 기울기 추정기 도입: $ \widetilde{g}_t^{\text{res}} = \frac{u_t}{\delta} \left( f_t(x_t + \delta u_t) - f_{t-1}(x_{t-1} + \delta u_{t-1}) \right) $.
  • 이러한 잔차 피드백을 사용해 각 시간 단계에서 단일 함수 쿼리만 허용되는 온라인 환경에서 기울기를 추정한다.
  • 리프시츠 및 미끄러움 조건을 가정하여 기울기 추정기의 2차 모멘트를 분석함으로써 이론적 위험 한계를 확립한다.
  • 정적 및 확률적 환경 모두에 대해 위험 한계를 유도하여, 낮은 분산으로 인한 향상된 수렴 속도를 보여준다.
  • 시간에 따른 기울기 노름 분산의 성장을 제어하기 위해 $ \alpha = \frac{4dL_0^2\eta^2}{\delta^2} $ 를 사용한 재귀 기대치 경계를 도입한다.
  • 시간에 따라 변화하는 목적 함수를 모델링하기 위해 제약 조건이 있는 총 변동량을 가진 가정 I.3을 도입하여 비정상 조건 하에서의 분석을 가능하게 한다.

실험 결과

연구 질문

  • RQ1온라인 영차수 최적화에서 기울기 추정 분산을 줄이기 위해 일점 피드백을 어떻게 개선할 수 있는가?
  • RQ2연속된 시간 단계 간의 잔차 피드백이 기존 일점 피드백보다 더 날카운 위험 한계를 제공할 수 있는가?
  • RQ3제안된 방법이 기존 일점 ZO 방법보다 더 약한 가정 하에 더 날카운 위험 한계를 달성하는가?
  • RQ4이 방법은 비정상적이고 적대적인 환경에서 시간에 따라 변화하는 최적화자를 효과적으로 추적할 수 있는가?
  • RQ5제안된 잔차 피드백 방법은 비볼록 온라인 최적화 문제에 대해 이론적으로 타당한가?

주요 결과

  • 제안된 잔차 피드백 방법은 기존 일점 피드백보다 기울기 추정의 분산이 크게 낮다.
  • 볼록 및 비볼록 문제 모두에서 기존 일점 ZO 방법보다 더 날카운 위험 한계를 달성하며, 특히 목적 함수 값이 클 경우 두드러진다.
  • 이론적 분석은 함수 값의 균일한 상한이 아닌, 시간에 따른 총 함수 변동량의 유계성과 같은 더 약한 가정에 기반한다.
  • 수치 실험을 통해 ZO에 잔차 피드백을 적용한 결과가 시간에 따라 변화하는 최적화자를 추적하는 데 기존 일점 방법보다 뛰어나게 나타났다.
  • 이 논문은 비볼록 온라인 최적화 문제에 대한 일점 영차수 최적화 방법의 이론적 위험 분석을 처음으로 제공한다.
  • 기울기 추정기의 2차 모멘트는 $ \frac{1}{1 - \alpha} \left( 16L_0^2(d+4)^2 + \frac{2d}{\delta^2}V_f^2 \right) $ 로 유계지며, 이는 안정성과 수렴성을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.