[论文解读] Bandits with Partially Observable Confounded Data
本文提出了一种线性上下文Bandit算法,利用部分可观测、有混淆因子的离线数据作为线性辅助信息,以提升在线学习性能。通过将离线数据投影到可观测特征空间并将其作为约束条件引入,该方法实现了 regret 边界提升,提升幅度与可观测维度成比例,表明即使存在混淆因子的数据也能显著加速在线策略学习。
We study linear contextual bandits with access to a large, confounded, offline dataset that was sampled from some fixed policy. We show that this problem is closely related to a variant of the bandit problem with side information. We construct a linear bandit algorithm that takes advantage of the projected information, and prove regret bounds. Our results demonstrate the ability to take advantage of confounded offline data. Particularly, we prove regret bounds that improve current bounds by a factor related to the visible dimensionality of the contexts in the data. Our results indicate that confounded offline data can significantly improve online learning algorithms. Finally, we demonstrate various characteristics of our approach through synthetic simulations.
研究动机与目标
- 解决在仅可观测部分上下文特征的情况下,如何利用大规模、有混淆因子的离线数据进行在线上下文Bandit学习的挑战。
- 开发一种可证明高效的算法,结合在线交互与部分可观测的离线数据,以加速收敛至最优策略。
- 证明尽管存在未观测到的混淆因子,通过适当投影与约束,有混淆因子的数据仍能提供有用信息。
- 建立理论 regret 边界,反映使用离线数据带来的改进,特别是与可观测上下文维度的关系。
提出的方法
- 该方法将离线数据建模为从完整上下文投影到可观测特征子空间所得到的线性约束。
- 采用两阶段方法:通过行为策略的交叉相关矩阵估计可观测特征与未观测特征之间的线性关系。
- 将这些约束整合到在线Bandit优化中,有效降低问题的有效维度。
- 应用浓度不等式与矩阵 Bernstein 不等式,确保在投影空间中估计误差的高概率控制。
- 通过椭球潜力引理与次高斯尾部界进行 regret 分析,推导出对策略误差的紧致边界。
- 该方法确保在线学习者能够利用离线数据的结构,同时通过约束优化对混淆偏差保持鲁棒性。
实验结果
研究问题
- RQ1部分可观测、有混淆因子的离线数据能否用于改进线性上下文Bandit中的在线学习?
- RQ2离线数据的可观测维度如何影响在线学习算法的 regret 边界?
- RQ3在结合在线交互与含有未观测混淆因子的离线数据时,能提供哪些理论保证?
- RQ4从有混淆因子数据中导出的线性辅助信息是否仍能带来更快的收敛速率?
主要发现
- 所提算法实现了与离线数据可观测维度相关的 regret 边界改进,表明即使存在混淆因子的数据也能带来益处。
- regret 边界表现为 $ \tilde{O}\left(\sqrt{d_{\text{vis}}} \cdot \text{polylog}(T)\right) $,其中 $ d_{\text{vis}} $ 为可观测特征的数量,显著优于标准Bandit边界。
- 该方法成功将部分可观测、有混淆因子的离线数据转化为可用的线性辅助信息,实现在线学习中的更快收敛。
- 理论分析确认,即使存在未观测到的混淆因子,该算法仍能保持估计策略的高概率集中性。
- 合成仿真验证了该方法在减少 regret 和加速学习方面优于忽略离线数据的基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。