Skip to main content
QUICK REVIEW

[논문 리뷰] Online convex optimization in the bandit setting: gradient descent without a gradient

Abraham D. Flaxman, Adam Tauman Kalai|ArXiv.org|2004. 08. 02.
Advanced Bandit Algorithms Research참고 문헌 17인용 수 12
한 줄 요약

이 논문은 단일 함수 평가를 통해 유도된 한점 기울기 추정치를 사용하여 $O(n^{5/6})$의 기대적 손실을 달성하는 밴딧 온라인 볼록 최적화 알고리즘을 제시한다. 이는 직접적인 기울기 접근 없이 기울기 하강법을 가능하게 하며, 무작위 편향을 통해 기울기를 근사하고 스무oth한 함수 프레임워크에 적용한다. 이는 Zinkevich의 온라인 기울기 하강법을 최소한의 피드백을 가진 밴딧 설정으로 확장한다.

ABSTRACT

We consider a the general online convex optimization framework introduced by Zinkevich. In this setting, there is a sequence of convex functions. Each period, we must choose a signle point (from some feasible set) and pay a cost equal to the value of the next function on our chosen point. Zinkevich shows that, if the each function is revealed after the choice is made, then one can achieve vanishingly small regret relative the best single decision chosen in hindsight. We extend this to the bandit setting where we do not find out the entire functions but rather just their value at our chosen point. We show how to get vanishingly small regret in this setting. Our approach uses a simple approximation of the gradient that is computed from evaluating a function at a single (random) point. We show that this estimate is sufficient to mimic Zinkevich's gradient descent online analysis, with access to the gradient (only being able to evaluate the function at a single point).

연구 동기 및 목표

  • 각 라운드 이후 기울기가 아닌 함수 값만 공개되는 밴딧 설정으로 온라인 볼록 최적화를 확장하기 위해.
  • 각 라운드당 단일 함수 평가만을 사용하는 기울기 하강 기반 알고리즘을 설계하여 직접적인 기울기 계산을 피하기 위해.
  • 제한된 피드백 하에서 온라인 볼록 최적화의 이론적 손실 경계를 확립하기 위해, 특히 무작위 대비자에 대한 $O(n^{5/6})$ 기대 손실을 위해.
  • 온라인 설정에서 진짜 기울기의 대체로 사용 가능한 한점 기울기 추정치의 엄밀한 분석을 제공하기 위해.
  • 무작위 편향을 사용하여 기울기를 근사함으로써, 기울기 접근이 불가능한 블랙박스 함수 환경으로 Zinkevich의 온라인 기울기 하강 프레임워크를 일반화하기 위해.

제안 방법

  • 알고리즘은 한점 기울기 추정치를 사용한다: $ \hat{g}_t = \frac{d}{\delta} c_t(x_t + \delta u_t) u_t $, 여기서 $ u_t $는 균일하게 무작위로 선택된 단위 벡터이다.
  • 이 추정치는 비용 함수 $ c_t $의 스무스한 변형인 $ \hat{f}(x) = \mathbb{E}[f(x + \delta u)] $ 의 기울기를 근사한다.
  • 이 방법은 추정된 기울기 $ \hat{g}_t $ 를 사용하여 투영 기울기 하강법을 적용하며, $ x_{t+1} = \Pi_S(x_t - \eta \hat{g}_t) $ 로 갱신한다.
  • 분석은 한점 추정치의 기대값이 스무스한 함수의 기울기와 일치함을 이용하여 낮은 편향을 보장한다.
  • 기하학적 성질을 향상시키기 위해, 볼록 집합 $ S $ 는 애핀 변환을 통해 등방향 위치로 변환된다.
  • 손실 경계는 변환된 도메인의 지름과 리프시츠 상수와의 관계를 통해 유도된다.

실험 결과

연구 질문

  • RQ1기울기가 아니라 함수 값만 관측되는 밴딧 설정에서 온라인 기울기 하강법을 효과적으로 적용할 수 있는가?
  • RQ2각 라운드당 단일 함수 평가만을 사용할 경우 온라인 볼록 최적화의 달성 가능한 손실 경계는 무엇인가?
  • RQ3공격적인 온라인 설정에서 한점 기울기 추정치는 진짜 기울기를 얼마나 잘 근사할 수 있는가?
  • RQ4전체 기울기 또는 다수의 평가 없이도 온라인 기울기 하강법의 손실을 경계할 수 있는가?
  • RQ5기하학적 구조(예: 등방향 위치)는 밴딧 온라인 최적화 알고리즘의 성능에 어떤 영향을 미치는가?

주요 결과

  • 알고리즘은 무작위 대비자에 대해 밴딧 온라인 볼록 최적화 설정에서 기대 손실 $ O(n^{5/6}) $ 을 달성한다.
  • 한점 기울기 추정치 $ \frac{d}{\delta} c_t(x_t + \delta u_t) u_t $ 는 $ c_t $ 의 스무스한 변형의 기울기의 불편추정치이다.
  • 지름 $ D $ 인 볼록 집합 $ S $ 과 $ L $-리프시츠 비용 함수에 대해, $ S $ 가 등방향 위치로 변환된 후 기대 손실은 $ 6n^{3/4}d(\sqrt{CLR} + C) $ 이하로 경계된다.
  • $ L $-리프시츠 가정 없이도 기대 손실은 $ 6n^{5/6}dC $ 이하로 경계되며, 여기서 $ C $ 는 함수 값의 상한이다.
  • 이 방법은 각 라운드당 단일 함수 평가만을 사용하여 기울기 접근 없이도 온라인 설정에서 기울기 하강법을 가능하게 한다.
  • 분석은 진짜 기울기가 알려져 있지 않거나 함수들이 공격적으로 선택된 상황에서도 한점 추정치가 수렴에 충분함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.