Skip to main content
QUICK REVIEW

[논문 리뷰] Minimizing Regret in Bandit Online Optimization in Unconstrained and Constrained Action Spaces.

Tatiana Tatarenko, Maryam Kamgarpour|arXiv (Cornell University)|2018. 06. 13.
Advanced Bandit Algorithms Research참고 문헌 23인용 수 3
한 줄 요약

이 논문은 한정된 행동 공간과 비한정 행동 공간 모두에서 O(nT^{2/3})의 리그레트 비율을 달성하는 새로운 제로오더 온라인 볼록 최적화 알고리즘을 제안한다. 이는 한정된 무작위화 전략을 사용한 한점 기반 기울기 추정을 활용하여 달성된다. 이 방법은 두점 피드백으로 확장되어 이론적 리그레트 하한과 일치한다.

ABSTRACT

We consider online convex optimization with a zero-order oracle feedback. In particular, the decision maker does not know the explicit representation of the time-varying cost functions, or their gradients. At each time step, she observes the value of the cost function evaluated at her chosen action. The objective is to minimize the regret, that is, the difference between the sum of the costs she accumulates and that of the static optimal action had she known the sequence of cost functions a priori. We present a novel algorithm to minimize the regret in both unconstrained and constrained action spaces. Our algorithm hinges on a classical idea of one-point estimation of the gradients of the cost functions based on their observed values. However, our choice of the randomization introduced and consequently the proof techniques differ from those of past work. Letting T denote the number of queries of the zero-order oracle and n the problem dimension, the regret rate achieved is O(nT^{2/3}) for both constrained and unconstrained action spaces. Moreover, we adapt the presented algorithm to the setting with two-point feedback and demonstrate that the adapted procedure achieves the theoretical lower bound on the regret.

연구 동기 및 목표

  • 비용 함수나 그 기울기가 명시적으로 알려져 있지 않은 제로오더 오ракูล 피드백을 가진 온라인 볼록 최적화 문제를 다루는 것.
  • 이 피드백 모델 하에서 비한정 및 제한된 행동 공간 모두에서 리그레트를 최소화하는 것.
  • 기존 방법보다 향상된 성능을 보이기 위해 새로운 무작위화 전략을 통한 기울기 추정 기법을 개발하는 것.
  • 제안된 알고리즘이 두점 피드백으로 확장되었을 때 이론적 리그레트 하한에 도달함을 보여주는 것.

제안 방법

  • 함수 값 관측만을 기반으로 시간에 따라 변하는 비용 함수의 기울기를 근사하기 위해 무작위 편향을 사용한 한점 기반 기울기 추정을 적용한다.
  • 기존 연구와 다름없이 특정한 무작위화 분포를 도입하여 더 날카운 리그레트 분석이 가능하도록 한다.
  • 제약된 행동 공간에서의 탇합성 유지와 함께 유한한 리그레트를 보장하는 투영을 포함하지 않는 업데이트 규칙을 설계한다.
  • 대칭적 편향을 사용하여 기울기 추정 정확도를 향상시키기 위해 알고리즘을 두점 피드백으로 확장한다.
  • 선택된 무작위화에 맞게 특화된 농도 및 마틴게일 추론을 통해 O(nT^{2/3})의 리그레트 한계를 유도한다.
  • 두점 피드백 변형이 알려진 이론적 리그레트 하한에 도달함을 입증하여, 이 설정에서의 최적성 확인

실험 결과

연구 질문

  • RQ1제로오더 온라인 최적화 알고리즘이 기울기 정보에 접근할 수 없을 때 비한정 및 제한된 행동 공간 모두에서 비선형 리그레트 비율을 달성할 수 있는가?
  • RQ2한점 기반 기울기 추정에서의 무작위화 선택이 고차원 설정에서 리그레트 한계에 어떤 영향을 미치는가?
  • RQ3제안된 알고리즘은 두점 피드백으로 확장되어 이론적 리그레트 하한과 일치시킬 수 있는가?
  • RQ4제로오더 온라인 볼록 최적화에서 추정 정확도와 리그레트 성장 간의 최적 균형은 무엇인가?

주요 결과

  • 제안된 알고리즘은 제로오더 피드백 하에서 비한정 및 제한된 행동 공간 모두에서 O(nT^{2/3})의 리그레트 비율을 달성한다.
  • 리그레트 한계는 제약 집합의 구체적 구조에 의존하지 않으며, 유일하게 차원 수와 시간 범위에 따라 결정된다.
  • 알고리즘의 무작위화 전략은 향상된 농도 성질을 유도하여 기존 방법보다 더 날카운 리그레트 분석이 가능하다.
  • 두점 피드백으로 확장되었을 때 알고리즘의 리그레트는 알려진 이론적 하한과 일치하여, 이 설정에서의 최적성을 확인한다.
  • 이 방법은 투영 또는 비용 함수 기울기의 명시적 지식이 필요 없으며, 오직 함수 값 질의에 의존한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.