[论文解读] Sparsity-Agnostic Lasso Bandit
该论文提出了一种稀疏性无关的Lasso多臂赌博机(Sparsity-Agnostic Lasso Bandit, SA Lasso Bandit),一种上下文赌博机算法,无需事先知晓稀疏性指数 $ s_0 $ 即可实现最优遗憾性能,通过以稀疏性无关的方式使用Lasso回归。该方法为两臂赌博机建立了紧致的遗憾界 $ \mathcal{O}(s_0\sqrt{T\log(dT)}) $,与离线Lasso的性能一致,并且即使在已知 $ s_0 $ 的现有方法中也表现更优。
We consider a stochastic contextual bandit problem where the dimension $d$ of the feature vectors is potentially large, however, only a sparse subset of features of cardinality $s_0 \ll d$ affect the reward function. Essentially all existing algorithms for sparse bandits require a priori knowledge of the value of the sparsity index $s_0$. This knowledge is almost never available in practice, and misspecification of this parameter can lead to severe deterioration in the performance of existing methods. The main contribution of this paper is to propose an algorithm that does not require prior knowledge of the sparsity index $s_0$ and establish tight regret bounds on its performance under mild conditions. We also comprehensively evaluate our proposed algorithm numerically and show that it consistently outperforms existing methods, even when the correct sparsity index is revealed to them but is kept hidden from our algorithm.
研究动机与目标
- 解决现有稀疏上下文赌博机算法中一个关键局限:需要事先知晓稀疏性指数 $ s_0 $,而这一信息在实际中通常不可得。
- 开发一种赌博机算法,其遗憾性能在 $ s_0 $ 和 $ d $ 上保持最优,且不依赖于 $ s_0 $ 的调参。
- 消除对依赖于 $ s_0 $ 的强制采样方案的需求,这类方案在以往工作中普遍存在,且会损害算法的鲁棒性。
- 通过实证结果证明,所提方法即使在已知真实 $ s_0 $ 的情况下,也始终优于现有算法。
提出的方法
- 该算法以稀疏性无关的方式使用 $ \ell_1 $-正则化回归(即Lasso)来估计未知参数向量 $ \beta^* $,避免显式依赖于 $ s_0 $。
- 采用基于置信区间的选择规则,以平衡探索与利用,依赖于Lasso估计器在高维设置下的稳定性。
- 通过Lasso的内在正则化确保经验Gram矩阵保持良好条件,从而避免强制采样,消除了对 $ s_0 $ 相关调参的需求。
- 理论分析利用集中不等式和Lasso估计器的性质,在较弱的正则性条件下推导出遗憾界。
- 对于两臂情形,该算法的遗憾被限制在 $ \mathcal{O}(s_0\sqrt{T\log(dT)}) $,与离线Lasso的最优率一致。
- 通过广义选择规则将该框架扩展至 $ K $-臂赌博机,保持相同的遗憾标度。
实验结果
研究问题
- RQ1能否设计一种上下文赌博机算法,在不依赖 $ s_0 $ 先验知识的前提下,实现与 $ s_0 $ 和 $ d $ 均最优的遗憾标度?
- RQ2如何在赌博机设置中使用基于Lasso的估计方法,以实现无需 $ s_0 $ 相关调参的性能保持?
- RQ3消除强制采样对稀疏赌博机问题中的遗憾性能与鲁棒性有何影响?
- RQ4当真实 $ s_0 $ 对现有方法可见而对所提方法不可见时,该算法与现有方法相比表现如何?
主要发现
- 稀疏性无关Lasso赌博机在两臂情形下实现了 $ \mathcal{O}(s_0\sqrt{T\log(dT)}) $ 的遗憾界,与离线Lasso的最优率一致。
- 在数值实验中,该算法即使在已知正确 $ s_0 $ 的情况下也优于现有方法,表现出更强的鲁棒性和更优的收敛性。
- 该方法消除了对强制采样的需求,而这类方法在以往工作中通常依赖于 $ s_0 $,从而显著提升了实际可应用性。
- 在不同相关性水平和特征分布(高斯、均匀、椭球)的实验中,SA Lasso赌博机保持了稳定的性能,而诸如DR Lasso赌博机等竞争方法在低相关性下性能显著下降。
- 随着 $ d $ 增加,该算法表现出平滑退化,且在 $ d \in \{100, 200, 400, 800\} $ 和 $ s_0 \in \{5, 10, 20\} $ 的范围内均保持强劲性能。
- 理论分析证实,遗憾界在 $ s_0 $ 和 $ d $ 上均实现最优标度,且在较弱正则性条件下可证明该方法近乎最优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。