Skip to main content
QUICK REVIEW

[논문 리뷰] Chasing Convex Bodies and Functions with Black-Box Advice

Nicolas Christianson, Tinashe Handina|arXiv (Cornell University)|2022. 06. 23.
Advanced Bandit Algorithms Research인용 수 8
한 줄 요약

이 논문은 블랙박스 조언을 사용하여 일致성과 내성 간의 조정 가능한 트레이드오프를 달성하는 두 가지 새로운 학습 보강 알고리즘, Interp와 BdInterp를 제안한다. 문제의 볼록성에 기반하여 BdInterp는 α-다각형 함수에 대해 (1+ε)-일치성과 O(D/ε)-내성을 달성하며, 이는 이전의 경계보다 크게 향상된 성능이다.

ABSTRACT

We consider the problem of convex function chasing with black-box advice, where an online decision-maker aims to minimize the total cost of making and switching between decisions in a normed vector space, aided by black-box advice such as the decisions of a machine-learned algorithm. The decision-maker seeks cost comparable to the advice when it performs well, known as $ extit{consistency}$, while also ensuring worst-case $ extit{robustness}$ even when the advice is adversarial. We first consider the common paradigm of algorithms that switch between the decisions of the advice and a competitive algorithm, showing that no algorithm in this class can improve upon 3-consistency while staying robust. We then propose two novel algorithms that bypass this limitation by exploiting the problem's convexity. The first, INTERP, achieves $(\sqrt{2}+ε)$-consistency and $\mathcal{O}(\frac{C}{ε^2})$-robustness for any $ε> 0$, where $C$ is the competitive ratio of an algorithm for convex function chasing or a subclass thereof. The second, BDINTERP, achieves $(1+ε)$-consistency and $\mathcal{O}(\frac{CD}ε)$-robustness when the problem has bounded diameter $D$. Further, we show that BDINTERP achieves near-optimal consistency-robustness trade-off for the special case where cost functions are $α$-polyhedral.

연구 동기 및 목표

  • 기계 학습 조언과 최악의 경우 내성 보장을 결합한 온라인 알고리즘을 설계하는 것.
  • 이전의 조언 보강 알고리즘들이 조언과 내성 기반 기준 간을 전환하는 방식으로 3-일치성 장벽을 극복하는 것.
  • 결정 공간의 볼록성에 기반하여 근사 최적의 일치성-내성 트레이드오프를 달성하는 것.
  • 조언 품질과 문제 기하학에 따라 부드럽게 스케일링되는 조정 가능한 성능 경계를 제공하는 것.
  • 학습 보강 온라인 알고리즘을 CFC 및 CBC 설정으로 확장하고, 증명 가능한 성능 보장을 제공하는 것.

제안 방법

  • 매개변수화된 볼록 조합을 사용하여 블랙박스 조언과 내성 기반 기준 알고리즘 사이를 보간하는 메타알고리즘인 Interp를 제안한다.
  • 최적 결론까지의 거리에 기반해 조언과 내성 전략 간에 동적으로 조정하는 이중경쟁 메타알고리즘인 BdInterp를 도입한다.
  • 이중경쟁 프레임워크를 활용하여 동시에 조언에 대한 성능과 최악의 경우 최적 시퀀스에 대한 성능를 경계한다.
  • 특히 유한 지름 설정에서 볼록 집합과 노름의 기하적 성질을 활용하여 날카로운 경쟁 비율을 유도한다.
  • 일치성과 내성을 균형 잡기 위해 파라미터 γ와 δ를 최적화하여, (1+ε)-일치성과 함께 O(D/ε)-내성을 달성한다.
  • 기존의 경쟁 알고리즘(예: 기능 스티너 포인트, 게으른 OBD)을 메타알고리즘 내의 내성 구성 요소로 활용한다.

실험 결과

연구 질문

  • RQ1학습 보강 알고리즘을 설계하여 조언에 가까운 일치성을 달성하면서도 최악의 경우 내성 보장을 유지할 수 있는가?
  • RQ2조언 보강 CFC에서 전환 기반 알고리즘의 3-일치성 장벽을 뛰어넘을 수 있는가?
  • RQ3볼록성은 일반적인 블랙박스 조언 방법보다 더 나은 일치성-내성 트레이드오프를 달성하는 데 활용될 수 있는가?
  • RQ4유한 지름 비용 함수를 가진 CFC에서 일치성과 내성 간의 최적 트레이드오프는 무엇인가?
  • RQ5제안된 알고리즘은 α-다각형 또는 k-CBC 문제와 같은 구조적 하위클래스에서 어떻게 성능을 내는가?

주요 결과

  • BdInterp는 α-다각형 함수에 대해 (1+ε)-일치성과 O(D/ε)-내성을 달성하며, 이는 이전의 O(1/ε²) 내성 경계보다 크게 향상된 성능이다.
  • 일반적인 CFC 및 CBC에 대해, BdInterp는 d차원 공간에서 임의의 노름을 사용할 경우 (1+ε)-일치성과 O(dD/ε)-내성을 달성한다.
  • Interp는 (√2+ε)-일치성과 O(C/ε²)-내성을 달성하며, 여기서 C는 기반 내성 알고리즘의 경쟁 비율이다.
  • k-CBC에서 BdInterp는 (1+ε)-일치성과 O(kD/ε)-내성을 달성하며, 활성 부분공간의 차원과 일치한다.
  • ℓ² 공간에서의 α-CFC에 대해, BdInterp는 (1+ε)-일치성과 O(D/(α¹ᐟ²ε))-내성을 달성하며, 이는 O(1/(α¹ᐟ²ε²)) 경계보다 향상된 성능이다.
  • BdInterp의 최적 파라미터 조정은 D가 알려지지 않은 상태에서도 (1+ε) 일치성과 함께 O(D/ε) 내성을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.