Skip to main content
QUICK REVIEW

[논문 리뷰] A Reduction from Delayed to Immediate Feedback for Online Convex Optimization with Improved Guarantees

Alexander Ryabchenko, Idan Attias|arXiv (Cornell University)|2026. 02. 02.
Advanced Bandit Algorithms Research인용 수 0
한 줄 요약

논문은 연속시간 지연 모델과 즉시 피드백 감소를 도입하여 온라인 볼록 최적화(OCO)와 밴딧 볼록 최적화(BCO)에서 지연-적응적 후퇴(bound)들을 개선된 형태로 제시한다. 이는 분석을 통합하고 지연과 볼록성에 적응하는 최적의 혹은 개선된 속도를 제공한다.

ABSTRACT

We develop a reduction-based framework for online learning with delayed feedback that recovers and improves upon existing results for both first-order and bandit convex optimization. Our approach introduces a continuous-time model under which regret decomposes into a delay-independent learning term and a delay-induced drift term, yielding a delay-adaptive reduction that converts any algorithm for online linear optimization into one that handles round-dependent delays. For bandit convex optimization, we significantly improve existing regret bounds, with delay-dependent terms matching state-of-the-art first-order rates. For first-order feedback, we recover state-of-the-art regret bounds via a simpler, unified analysis. Quantitatively, for bandit convex optimization we obtain $O(\sqrt{d_{ ext{tot}}} + T^{\frac{3}{4}}\sqrt{k})$ regret, improving the delay-dependent term from $O(\min\{\sqrt{T d_{ ext{max}}},(Td_{ ext{tot}})^{\frac{1}{3}}\})$ in previous work to $O(\sqrt{d_{ ext{tot}}})$. Here, $k$, $T$, $d_{ ext{max}}$, and $d_{ ext{tot}}$ denote the dimension, time horizon, maximum delay, and total delay, respectively. Under strong convexity, we achieve $O(\min\{σ_{ ext{max}} \ln T, \sqrt{d_{ ext{tot}}}\} + (T^2\ln T)^{\frac{1}{3}} {k}^{\frac{2}{3}})$, improving the delay-dependent term from $O(d_{ ext{max}} \ln T)$ in previous work to $O(\min\{σ_{ ext{max}} \ln T, \sqrt{d_{ ext{tot}}}\})$, where $σ_{ ext{max}}$ denotes the maximum number of outstanding observations and may be considerably smaller than $d_{ ext{max}}$.

연구 동기 및 목표

  • 라운드 의존 지연을 가진 온라인 학습을 연속시간 프레임워크로 동기화하고 모델링한다.
  • 첫 번째 차수와 밴딧 피드백 모두에 작동하는 지연-즉시 피드백 감소를 개발한다.
  • 지연 매개변수에 대한 사전 지식이 필요하지 않은 지연-적응적 후퇴 경계를 제공한다.
  • 밴딧 볼록 최적화에서 개선된 후퇴 속도를 달성하고, 1차 OCO에서 상태-최대 경계를 회복한다.
  • 드리프트-패널티를 적용한 온라인 선형 최적화(OLO) 감소를 통해 통합 분석을 제공한다.

제안 방법

  • 피드백이 지연되는 것을 비지연 업데이트로 전환하는 래퍼를 통해 지연된 OCO/BCO를 드리프트-패널티 온라인 선형 최적화(OLO)로 축약한다.
  • 예측과 관찰이 타임라인상의 이벤트로 간주되는 연속시간 모델을 도입하여 비지연 후퇴와 예측 드리프트로 자연스러운 후퇴 분해를 가능하게 한다.
  • 지연 관련 양들(지연, 적체, 그리고 이들의 이중성) 간 등가성을 보이고, 안정된 알고리즘에 대한 후퇴 분해를 증명한다.
  • 프로시말 팔리트 프롬더럴-레이트(FTRL)와 온라인 미러 디센트(OMD)를 래핑하여 지연-적응적 후퇴 경계를 달성한다.
  • 밴딧 피드백에 대한 단일점 그래디언트 추정법을 같은 감소 프레임워크 내에서 적용한다.
  • 큰 지연이 발생할 때 지연의 영향을 더 줄이기 위한 적응형 건너뛰기 스킴을 도입한다.

실험 결과

연구 질문

  • RQ1온라인 볼록 최적화에서 지연된 피드백을 사전 지식 없이 어떻게 모델링하고 분석할 수 있는가?
  • RQ2지연된 OCO와 BCO를 드리프트 페널티가 있는 비지연 문제로 축약하여 1차 및 밴딧 설정 전반에서 적응적 후퇴 경계를 얻을 수 있는가?
  • RQ3볼록성과 강볼록성 손실 함수 하에서의 후퇴 경계는 무엇이며, d_tot, d_max, sigma_max와 같은 지연 양에 어떻게 의존하는가?
  • RQ4제안된 감소가 두 점 밴딧 피드백을 포함한 지연된 OCO와 BCO의 상태-최신 경계를 회복하거나 개선하는가?

주요 결과

  • 지연이 있는 밴딧 볼록 최적화의 경우, 감소는 기대 후퇴가 O(√(d_tot) + T^{3/4}√k) 이다.
  • 강볼록 밴딧 손실의 경우, 경계가 O(min{sigma_max ln T, √(d_tot)} + (T^2 ln T)^{1/3} k^{2/3})로 개선된다.
  • 1차 피드백이 있는 온라인 볼록 최적화의 경우, 감소는 볼록한 경우에 O(√(d_tot) + √T) 후퇴를 회복한다.
  • 강볼록성하에서 1차 OCO 경계는 O(min{sigma_max ln T, √(d_tot)} + (T^2 ln T)^{1/3} k^{2/3})로 바뀐다.
  • 프레임워크는 d_max, d_tot, sigma_max, 또는 T에 대한 사전 지식이 필요하지 않는 지연-적응 보장을 제공하며, 건너뛰기를 통해 지연 항을 O(min_Q {|Q| + (sum_{t not in Q} d_t)^{1/2}})로 추가로 축소할 수 있다.
  • 두 점 밴딧 피드백 확장은 볼록한 경우 O(√(d_tot) + √(Tk))의 후퇴 경계와 강볼록성 하에서 O(min{sigma_max ln T, √(d_tot)} + k ln T)를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.