Skip to main content
QUICK REVIEW

[논문 리뷰] A New One-Point Residual-Feedback Oracle For Black-Box Learning and Control

Yan Zhang, Yi Zhou|arXiv (Cornell University)|2020. 06. 18.
Advanced Bandit Algorithms Research참고 문헌 29인용 수 5
한 줄 요약

이 논문은 블랙박스 학습 및 제어에서 제로스오더 최적화를 위한 새로운 일점 잔차 피드백 오라클을 제안한다. 이 방법은 각 반복에서의 함수 평가를 한 번만 사용하면서도 연속된 반복점 간의 잔차 차이를 이용해 기울기를 추정한다. 이론적으로는 결정론적 환경에서 두 점 피드백 방법과 동일한 쿼리 복잡도를 달성하고, 확률론적 환경에서는 두 점 방법의 수렴 속도를 재현하여, 사전에 전체 데이터를 확보할 수 없는 효율적인 온라인 최적화를 가능하게 한다.

ABSTRACT

Zeroth-order optimization (ZO) algorithms have been recently used to solve black-box or simulation-based learning and control problems, where the gradient of the objective function cannot be easily computed but can be approximated using the objective function values. Many existing ZO algorithms adopt two-point feedback schemes due to their fast convergence rate compared to one-point feedback schemes. However, two-point schemes require two evaluations of the objective function at each iteration, which can be impractical in applications where the data are not all available a priori, e.g., in online optimization. In this paper, we propose a novel one-point feedback scheme that queries the function value once at each iteration and estimates the gradient using the residual between two consecutive points. When optimizing a deterministic Lipschitz function, we show that the query complexity of ZO with the proposed one-point residual feedback matches that of ZO with the existing two-point schemes. Moreover, the query complexity of the proposed algorithm can be improved when the objective function has Lipschitz gradient. Then, for stochastic bandit optimization problems where only noisy objective function values are given, we show that ZO with one-point residual feedback achieves the same convergence rate as that of two-point scheme with uncontrollable data samples. We demonstrate the effectiveness of the proposed one-point residual feedback via extensive numerical experiments.

연구 동기 및 목표

  • 일점 피드백의 높은 분산과 느린 수렴 속도로 인한 제로스오더 최적화의 비효율성을 해결하기 위해.
  • 결정론적 및 확률론적 환경에서 두 점 피드백 방법과 동일한 쿼리 복잡도를 달성하는 일점 피드백 방법을 개발하기 위해.
  • 함수 평가가 비용이 많이 들거나 데이터가 순차적으로 도착하는 상황에서 실용적인 온라인 최적화를 가능하게 하기 위해.
  • 특히 블랙박스 제어 및 학습 환경에서 수렴 속도를 희생시키지 않고도 반복당 함수 쿼리 수를 줄이기 위해.

제안 방법

  • 연속된 점에서의 함수 값 간의 차이를 이용해 기울기를 추정하는 일점 잔차 피드백 기울기 추정기법을 제안한다.
  • 이 추정기법은 $ \widetilde{\nabla}f(x) = \frac{1}{\delta} \left( f(x + \delta u) - f(x) \right) u $로 정의되며, 여기서 $ u $ 는 표준 정규분포에서 샘플링된다.
  • 잔차 역학을 활용하여 추정 분산을 줄이는 새로운 분석 프레임워크를 도입하여, 두 점 방법과 비교할 만한 성능을 달성한다.
  • 편향과 분산을 균형 잡기 위해 적응형 스텝 사이즈 $ \eta \propto 1/\sqrt{T} $ 와 탐색 파라미터 $ \delta \propto T^{-1/4} $ 를 사용한다.
  • 확률론적 환경에서 노이즈를 줄이기 위해 마이너스배치 기울기 추정 $ \widetilde{g}_b(x) $ 를 활용하며, 배치 크기 $ b \propto \sqrt{T}/d $ 이다.
  • 리프시츠 및 미끄러짐 조건을 가정하여 수렴성을 분석하고, 기대 최적성 오차 및 기울기 노름에 대한 경계를 유도한다.

실험 결과

연구 질문

  • RQ1일점 피드백 방법이 제로스오더 최적화에서 두 점 피드백 방법과 동일한 쿼리 복잡도를 달성할 수 있는가?
  • RQ2잔차 기반 기울기 추정이 분산을 충분히 줄여 두 점 방법의 수렴 속도를 재현할 수 있는가?
  • RQ3노이즈 있는 함수 평가가 존재하는 확률론적 환경에서도 제안된 방법이 빠른 수렴을 유지할 수 있는가?
  • RQ4제안된 프레임워크에서 스텝 사이즈, 탐색 파라미터, 배치 크기 사이의 최적의 트레이드오프는 무엇인가?

주요 결과

  • 제안된 일점 잔차 피드백 방법은 결정론적 볼록 문제에서 $ \mathcal{O}(d^2 \epsilon^{-2}) $ 의 쿼리 복잡도를 달성하며, 최고의 두 점 방법과 동일한 성능을 보인다.
  • 부드러운 함수에 대해서는 쿼리 복잡도가 $ \mathcal{O}(d^3 \epsilon^{-1.5}) $ 로 향상되어 기존의 일점 방법보다 뛰어나다.
  • 확률론적 환경에서는 $ \mathcal{O}(\sigma^2 d^2 \epsilon^{-3} + \sigma_g^2 d \epsilon^{-2}) $ 의 쿼리 복잡도를 달성하여, 통제할 수 없는 데이터 상황에서도 두 점 방법과 동일한 성능을 보인다.
  • 수렴 속도는 $ \mathcal{O}(d / \sqrt{T} + d^2 / T) $ 이며, 이는 $ \epsilon $-정확도를 달성하기 위해 $ T = \mathcal{O}(d^2 \epsilon^{-2}) $ 번의 반복이 필요함을 의미한다.
  • 이론적 분석을 통해 잔차 피드백가 분산을 효과적으로 줄여 일점 방법이 두 점 방법의 쿼리 복잡도 성능을 재현할 수 있음을 확인한다.
  • 수치 실험을 통해 다양한 블랙박스 최적화 과제에서 방법의 효과성을 검증하였으며, 빠른 수렴성과 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.