[论文解读] Post-Contextual-Bandit Inference
本文提出了上下文自适应双重稳健(CADR)估计器,这是首个在自适应数据收集的上下文Bandit设置中实现渐近正态推断的方法。通过利用基于重要性采样比率推导出的自适应、一致的条件方差估计来稳定双重稳健估计器,CADR实现了有效的95%置信区间——在先前方法失效的57个OpenML数据集中均实现了正确的覆盖率。
Contextual bandit algorithms are increasingly replacing non-adaptive A/B tests in e-commerce, healthcare, and policymaking because they can both improve outcomes for study participants and increase the chance of identifying good or even best policies. To support credible inference on novel interventions at the end of the study, nonetheless, we still want to construct valid confidence intervals on average treatment effects, subgroup effects, or value of new policies. The adaptive nature of the data collected by contextual bandit algorithms, however, makes this difficult: standard estimators are no longer asymptotically normally distributed and classic confidence intervals fail to provide correct coverage. While this has been addressed in non-contextual settings by using stabilized estimators, the contextual setting poses unique challenges that we tackle for the first time in this paper. We propose the Contextual Adaptive Doubly Robust (CADR) estimator, the first estimator for policy value that is asymptotically normal under contextual adaptive data collection. The main technical challenge in constructing CADR is designing adaptive and consistent conditional standard deviation estimators for stabilization. Extensive numerical experiments using 57 OpenML datasets demonstrate that confidence intervals based on CADR uniquely provide correct coverage.
研究动机与目标
- 为解决上下文Bandit实验中因自适应数据收集而使标准置信区间失效的问题。
- 开发一种在上下文相关自适应数据收集下实现渐近正态性的估计器。
- 在现实世界自适应实验中,为平均处理效应、子群效应或策略价值构建具有正确覆盖率的置信区间。
- 克服在上下文设置中设计一致且自适应的条件方差估计器以实现稳定化的挑战。
- 在保持有效推断的同时,对结果模型误设保持稳健。
提出的方法
- 提出上下文自适应双重稳健(CADR)估计器,作为对规范得分的加权时间平均的稳定化版本,通过估计的条件标准差进行逆权重。
- 利用每个时间点当前策略与过去策略之间的重要性采样比率,设计自适应的条件方差估计器。
- 采用交叉拟合和插补估计方法对结果模型进行估计,以确保在自适应采样下的一致性。
- 使用双重稳健估计方法,即使结果模型误设,也能保持渐近正态性。
- 应用方差稳定化,以减少高方差区域中高逆倾向得分的影响。
- 通过在57个OpenML数据集上进行广泛实验,验证了该方法在结果模型正确设定和误设情况下的有效性。
实验结果
研究问题
- RQ1我们能否在自适应且与上下文相关的上下文Bandit实验中,为策略价值构建有效的置信区间?
- RQ2在上下文自适应数据收集下,是否可能实现策略价值估计器的渐近正态性?
- RQ3我们如何设计一致且自适应的条件方差估计器,以在该设置中稳定双重稳健估计器?
- RQ4当结果模型误设时,CADR估计器是否仍能保持正确的覆盖率?
- RQ5在多样化的现实世界数据集中,CADR与现有估计器(如DR、IPW、DM和ADR)相比,在覆盖率准确性方面表现如何?
主要发现
- CADR在57个OpenML数据集中均实现了正确的95%置信区间覆盖率,而所有基线方法(DR、IPW、DM、ADR、MRDR)均无法维持有效覆盖率。
- 在结果模型误设(线性模型)的情况下,CADR在72个数据集中的38个上显著优于DR,且在方差稳定化方面有显著改进。
- 当结果模型正确设定(使用决策树)时,CADR与DR的覆盖率表现相当,但CADR在不同数据分布下仍更具鲁棒性。
- 使用重要性采样加权训练结果模型的变体CAMRDR,在正确设定情况下表现略优于CADR,在误设情况下略逊于CADR,但依然优于所有基线方法。
- CADR估计器的渐近正态性对结果模型误设具有鲁棒性,即使结果模型不准确,也能实现可靠的推断。
- 大量实验结果表明,CADR是唯一一种在结果模型正确设定和误设情况下均能持续保持正确覆盖率的方法,确立了其作为上下文Bandit数据首个有效推断方法的地位。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。