Skip to main content
QUICK REVIEW

[论文解读] Adversarial Combinatorial Bandits with General Non-linear Reward Functions

Xi Chen, Yanjun Han|arXiv (Cornell University)|Jan 5, 2021
Advanced Bandit Algorithms Research参考文献 14被引用 6
一句话总结

本文確立了具有通用非線形獎勵函數的敵對組合Bandit問題的最小最大 regret,顯示當獎勵函數為低次多項式(次數 $d < K$)時,regret 的增長為 $ frac{ ilde{ ext{O}}_d( ext{poly}(N,K)T)}{\sqrt{N^dT}}$,否則為 $ frac{ ext{O}_K( ext{poly}(N,K)T)}{\sqrt{N^KT}}$。結果揭示了線性與非線性獎勵結構之間的根本差異,暗示非線性函數會阻礙對子集相關性的利用。

ABSTRACT

In this paper we study the adversarial combinatorial bandit with a known non-linear reward function, extending existing work on adversarial linear combinatorial bandit. {The adversarial combinatorial bandit with general non-linear reward is an important open problem in bandit literature, and it is still unclear whether there is a significant gap from the case of linear reward, stochastic bandit, or semi-bandit feedback.} We show that, with $N$ arms and subsets of $K$ arms being chosen at each of $T$ time periods, the minimax optimal regret is $\widetildeΘ_{d}(\sqrt{N^d T})$ if the reward function is a $d$-degree polynomial with $d&lt; K$, and $Θ_K(\sqrt{N^K T})$ if the reward function is not a low-degree polynomial. {Both bounds are significantly different from the bound $O(\sqrt{\mathrm{poly}(N,K)T})$ for the linear case, which suggests that there is a fundamental gap between the linear and non-linear reward structures.} Our result also finds applications to adversarial assortment optimization problem in online recommendation. We show that in the worst-case of adversarial assortment problem, the optimal algorithm must treat each individual $\binom{N}{K}$ assortment as independent.

研究动机与目标

  • 為敵對組合Bandit問題中具有通用非線性獎勵函數的最小最大 regret 提供完整表徵,這是 bandit 文獻中長期未解的開放問題。
  • 確定非線性獎勵函數是否會根本性地改變與線性或隨機設定相比的信息理論複雜度。
  • 建立依賴於獎勵函數次數的緊緻 regret 界,特別區分低次多項式與高次或多項式以外的函數。
  • 展示這些界限對實際應用(如多項式對數模型下的敵對組合優化)的影響。

提出的方法

  • 作者透過精心設計的獎勵向量上的敵對分佈,推導出最小最大 regret 的下界,利用對稱性與泰勒展開技術分析獎勵函數在關鍵點周圍的行為。
  • 他們使用多變量泰勒展開與多指標符號,分析獎勵函數 $g$ 對累積臂值的導數,識別出高階導數消失的條件。
  • 一個關鍵技術步驟是證明滿足特定線性約束的非零向量 $\lambda$ 不存在,從而導致矛盾,並確立函數曲率的非退化性。
  • 分析區分了 $g$ 為次數 $d < K$ 的多項式與否兩種情況,根據函數結構使用不同的下界構造。
  • 對於非多項式或高次多項式函數的情況,下界構造將每組 $K$ 個臂的子集視為獨立,暗示無法利用任何相關性。
  • 上界透過簡化至線性 Bandit 問題中已知的演算法推導,並調整以適應非線性結構,但主要貢獻在於緊緻的下界。

实验结果

研究问题

  • RQ1在具有非線性獎勵函數的敵對組合Bandit問題中,是否可能達成 $\widetilde{O}(\sqrt{\mathrm{poly}(N,K)T})$ 的 regret?
  • RQ2獎勵函數的結構——特別是是否為低次多項式——是否會影響基本的最小最大 regret?
  • RQ3當獎勵函數為非線性時,演算法是否能利用不同臂子集之間的相關性?
  • RQ4在多項式對數模型下,敵對組合優化的最小最大 regret 是多少?
  • RQ5當獎勵函數非多項式或次數 $\geq K$ 時,regret 的增長方式為何?

主要发现

  • 當獎勵函數 $g$ 為次數 $d < K$ 的多項式時,最小最大 regret 為 $\widetilde{\Theta}_d(\sqrt{N^dT})$,顯示相比一般情況有顯著改進。
  • 當 $g$ 非低次多項式時,最小最大 regret 為 $\Theta_K(\sqrt{N^KT})$,表示任何演算法均無法利用子集之間的結構相關性。
  • 此結果揭示了線性與非線性獎勵函數之間的根本差異,因為線性情況可達 $\widetilde{O}(\sqrt{NT})$,此結果在 $K > 1$ 時嚴格優於 $\widetilde{O}(\sqrt{N^KT})$。
  • 針對非多項式或高次 $g$ 的下界構造,暗示 $\binom{N}{K}$ 種可能的子集均須視為獨立,使相關性利用在資訊理論上不可能。
  • 此結果可直接應用於多項式對數模型下的敵對組合優化,其中最壞情況下的最佳 regret 為 $\Theta_K(\sqrt{N^KT})$。
  • 分析顯示,若存在滿足由導數導出的線性方程組的非零向量 $\lambda$,將導致矛盾,從而證明函數曲率不可能退化至可改善 regret 的程度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。