[论文解读] Semiparametric Contextual Bandits
本文提出了一种新颖的半参数上下文Bandit算法,将奖励建模为动作特征的线性函数加上一个非线性、与动作无关的混杂因子。通过利用双重稳健的奖励估计器和一种新型随机探索策略,该方法实现了$\tilde{O}(d\sqrt{T})$的遗憾——与线性Bandit的最佳已知界限一致——同时对非线性混杂效应保持鲁棒性,在存在混杂奖励的实验评估中优于先前的方法。
This paper studies semiparametric contextual bandits, a generalization of the linear stochastic bandit problem where the reward for an action is modeled as a linear function of known action features confounded by an non-linear action-independent term. We design new algorithms that achieve $ ilde{O}(d\sqrt{T})$ regret over $T$ rounds, when the linear function is $d$-dimensional, which matches the best known bounds for the simpler unconfounded case and improves on a recent result of Greenewald et al. (2017). Via an empirical evaluation, we show that our algorithms outperform prior approaches when there are non-linear confounding effects on the rewards. Technically, our algorithms use a new reward estimator inspired by doubly-robust approaches and our proofs require new concentration inequalities for self-normalized martingales.
研究动机与目标
- 解决参数Bandit(高效但对模型误设敏感)与无模型Bandit(鲁棒但统计效率低下)之间的差距。
- 设计一种上下文Bandit算法,既保持参数方法的统计效率,又能对奖励中的非线性、与动作无关的混杂因素保持鲁棒性。
- 在存在混杂因素的情况下,实现与线性随机Bandit最优的$\tilde{O}(d\sqrt{T})$遗憾率相匹配的遗憾边界。
- 开发一种新的估计器和算法框架,确保在半参数假设下的一致性和遗憾控制。
提出的方法
- 提出一种针对具有非线性混杂因子的线性模型的新型双重稳健奖励估计器,借鉴了半参数统计与计量经济学的方法。
- 提出一种受动作消除启发的随机探索算法,经调整后适用于上下文Bandit设置,以确保估计的一致性。
- 采用一种针对向量值过程的自归一化鞅集中不等式,该不等式基于de la Peña等人提出的方法推导,用于控制估计误差。
- 使用一个随时间变化的正则化参数$\gamma(T)$的线性参数$\theta$的置信集,以确保对自适应对手选择的特征和混杂因子序列具有鲁棒性。
- 采用基于过滤的遗憾分解方法,将估计误差与探索-利用权衡分离。
- 通过结合Azuma不等式与Freedman不等式来推导鞅偏差的高概率遗憾边界。
实验结果
研究问题
- RQ1当奖励受非线性、与动作无关的项混杂时,我们能否在上下文Bandit中实现最优的$\tilde{O}(d\sqrt{T})$遗憾?
- RQ2是否可能在保持参数Bandit的统计效率的同时,获得对混杂导致的模型误设的鲁棒性?
- RQ3在奖励函数整体非线性的情况下,如何设计一个对线性参数的一致估计器,而无需假设全奖励函数的线性性?
- RQ4在存在混杂奖励的半参数Bandit设置中,随机探索策略是否能优于基于乐观主义的方法?
- RQ5在自适应、Bandit反馈设置中分析半参数估计器时,需要哪些新的集中不等式?
主要发现
- 所提出的算法在$T$轮内实现了$\tilde{O}(d\sqrt{T})$的遗憾,与线性随机Bandit的最佳已知边界一致。
- 即使特征和混杂因子由自适应对手选择,该遗憾边界依然成立,表明其具有强大的鲁棒性。
- 实验评估表明,当存在混杂效应时,该算法显著优于参数基线和无模型基线。
- 在无混杂的情况下,该算法保持了有竞争力的性能,略逊于参数基线但依然有效。
- 理论分析引入了一种针对向量值过程的新型自归一化鞅不等式,实现了更紧的集中边界。
- 双重稳健估计器确保了即使在混杂因子模型误设的情况下,对线性参数$\theta$的估计仍具有一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。