Skip to main content
QUICK REVIEW

[论文解读] Accurate Inference for Adaptive Linear Models

Yash Deshpande, Lester Mackey|arXiv (Cornell University)|Dec 18, 2017
Advanced Bandit Algorithms Research参考文献 49被引用 5
一句话总结

本文提出了一种新颖的 $\boldsymbol{W}$-去相关方法,用于校正由于顺序依赖的数据收集而引起的自适应线性回归估计量中的偏差。通过仅利用粗略的策略信息,将估计量偏差转化为方差,该方法实现了渐近正态推断,并在多臂老虎机和自回归采样设置下构建了准确的置信区间,其覆盖性和区间宽度均优于标准OLS和基于集中不等式的估计方法。

ABSTRACT

Estimators computed from adaptively collected data do not behave like their non-adaptive brethren. Rather, the sequential dependence of the collection policy can lead to severe distributional biases that persist even in the infinite data limit. We develop a general method -- $\mathbf{W}$-decorrelation -- for transforming the bias of adaptive linear regression estimators into variance. The method uses only coarse-grained information about the data collection policy and does not need access to propensity scores or exact knowledge of the policy. We bound the finite-sample bias and variance of the $\mathbf{W}$-estimator and develop asymptotically correct confidence intervals based on a novel martingale central limit theorem. We then demonstrate the empirical benefits of the generic $\mathbf{W}$-decorrelation procedure in two different adaptive data settings: the multi-armed bandit and the autoregressive time series.

研究动机与目标

  • 解决自适应线性模型中因数据收集策略导致的序列依赖性而引发的偏差推断问题。
  • 开发一种通用方法,将估计量中的偏差转化为方差,且无需了解数据收集策略的详细信息。
  • 在自适应采样下,基于一种新颖的鞅中心极限定理,建立参数估计的渐近有效置信区间。
  • 在两种自适应设置下(多臂老虎机和自回归时间序列)对方法进行经验验证。
  • 证明所提出的 $\boldsymbol{W}$-估计量在覆盖性上达到名义水平,且区间宽度优于基于集中不等式的估计方法。

提出的方法

  • 引入一种 $\boldsymbol{W}$-去相关估计量,通过从数据收集策略中导出的加权矩阵,将原始估计量分解为偏差和方差两部分。
  • 采用一种新颖的鞅中心极限定理,证明在矩稳定性与弱探索条件下,$\boldsymbol{W}$-估计量的渐近正态性。
  • 仅依赖于策略的粗粒度信息——无需访问倾向得分或精确的策略动态信息——从而实现广泛适用性。
  • 引入调优参数 $\boldsymbol{\nu}$ 以控制偏差与方差之间的权衡,并提供有限样本性能的理论边界。
  • 基于 $\boldsymbol{W}$-估计量的渐近正态性推导置信区间,确保在弱正则性条件下具有正确的覆盖性。
  • 通过蒙特卡洛模拟在多臂老虎机和AR(2)时间序列设置下验证该方法,与OLS和基于集中不等式的估计方法比较覆盖性和区间宽度。

实验结果

研究问题

  • RQ1当数据以自适应方式收集时,即使标准估计量存在严重分布偏差,我们能否为线性模型参数构建置信区间?
  • RQ2在仅使用粗略策略信息的前提下,自适应线性回归估计量中的偏差在多大程度上可被转化为方差?
  • RQ3$\boldsymbol{W}$-去相关方法在多臂老虎机和时间序列等设置下是否能实现渐近正态性并获得正确的经验覆盖?
  • RQ4$\boldsymbol{W}$-估计量的置信区间在宽度和覆盖性上与标准OLS及基于集中不等式的方法相比如何?
  • RQ5在弱探索条件下(如老虎机策略中的平均探索),该方法能否保持准确的推断?

主要发现

  • $\boldsymbol{W}$-去相关估计量在多臂老虎机和AR(2)时间序列设置下,其经验覆盖性均接近名义水平,而标准OLS则系统性地覆盖不足。
  • 在多臂老虎机设置下,$\boldsymbol{W}$-估计量的覆盖性始终优于标准OLS区间,避免了因偏差导致的高斯推断扭曲。
  • 基于集中不等式的OLS区间覆盖性接近100%,但极为保守;而 $\boldsymbol{W}$-去相关区间显著更窄,且在中等置信水平下更为不保守。
  • 在AR(2)时间序列中,$\boldsymbol{W}$-估计量的误差分布接近正态分布,而OLS误差分布呈偏态,证实了其更优的渐近行为。
  • 对于UCB、ECB和Thompson Sampling策略,$\boldsymbol{W}$-去相关区间始终比基于集中不等式的区间更窄,且覆盖性相当或更优。
  • 在弱探索条件下(包括多臂老虎机中的平均探索),该方法实现了近乎最优的偏差与方差控制,验证了其鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。