[论文解读] Markovian Interference in Experiments
本文提出了差异-Q(Differences-In-Q, DQ)估计器,用于在具有马尔可夫干扰的实验中进行因果推断,其中由于存在诸如库存有限等共享约束,干预会影响系统状态。通过利用一种新颖的在线策略估计框架,该框架相比离线策略方法具有二阶偏差和指数级降低的方差,DQ在偏差-方差权衡方面表现更优,在理论和模拟中均优于启发式方法和无偏估计器。
We consider experiments in dynamical systems where interventions on some experimental units impact other units through a limiting constraint (such as a limited inventory). Despite outsize practical importance, the best estimators for this `Markovian' interference problem are largely heuristic in nature, and their bias is not well understood. We formalize the problem of inference in such experiments as one of policy evaluation. Off-policy estimators, while unbiased, apparently incur a large penalty in variance relative to state-of-the-art heuristics. We introduce an on-policy estimator: the Differences-In-Q's (DQ) estimator. We show that the DQ estimator can in general have exponentially smaller variance than off-policy evaluation. At the same time, its bias is second order in the impact of the intervention. This yields a striking bias-variance tradeoff so that the DQ estimator effectively dominates state-of-the-art alternatives. From a theoretical perspective, we introduce three separate novel techniques that are of independent interest in the theory of Reinforcement Learning (RL). Our empirical evaluation includes a set of experiments on a city-scale ride-hailing simulator.
研究动机与目标
- 为解决在具有马尔可夫干扰的实验中,平均处理效应(ATE)估计缺乏理论基础、低偏差、低方差估计器的问题,其中干预会影响共享系统状态。
- 将问题形式化为马尔可夫决策过程(MDP)中的策略评估,特别是在简单随机化条件下,避免依赖复杂的实验设计。
- 开发一种在线策略估计器,其方差可被严格证明小于离线策略评估,同时在处理效应上保持二阶偏差。
- 在强化学习中建立理论基础,包括对ATE的新型泰勒型展开以及对策略评估的偏差-方差分析。
提出的方法
- 提出DQ估计器作为一种新颖的在线策略估计器,使用策略评估恒等式的修改形式,将标准奖励替换为目标策略下期望奖励的估计。
- 基于行为策略的平稳分布和价值函数,推导出一个代理目标函数,利用扰动界分析偏差。
- 采用ATE的泰勒型展开(定理5)来表征偏差,其与转移概率和策略之间距离相关。
- 引入一种修改后的迪尼金型恒等式用于策略评估,其中Q函数和V函数在辅助MDP上计算,奖励按目标策略的期望奖励重新加权。
- 采用类似信赖域的框架,但通过在辅助MDP中修改奖励函数以减少偏差,从而导出DQ估计器的关键性质。
- 建立DQ估计器的渐近正态性,并提供其方差的显式表征,表明其方差可比任何无偏离线策略估计器小指数级。
实验结果
研究问题
- RQ1是否一种新颖的在线策略估计器能在具有马尔可夫干扰的实验中,实现显著低于无偏离线策略估计器的方差?
- RQ2DQ估计器的偏差结构是什么?与现有离线策略和启发式估计器相比有何差异?
- RQ3DQ估计器能否从一种考虑策略诱导的转移动态变化的修改版策略评估恒等式中推导得出?
- RQ4当处理效应较小时,DQ估计器是否仍保持二阶偏差?这在实际中如何影响其性能?
- RQ5DQ估计器能否被推广以通过更优的偏差-方差控制来改进强化学习中的策略优化?
主要发现
- 当干预对转移概率的影响为$O(\delta)$时,DQ估计器表现出二阶偏差$O(\delta^2)$,相比离线策略方法显著降低了偏差。
- DQ估计器的方差可比任何无偏离线策略估计器小指数级,尤其在高维或复杂MDP中表现更优。
- 在城市规模的叫车模拟器中,DQ估计器在偏差和均方误差方面均优于最先进的替代方法,展现出实际优越性。
- DQ估计器的偏差为$O((\delta\delta')^2)$,相比信赖域代理的$O(\delta(\delta')^2)$偏差小一个因子$\delta$,即使$\delta'$无界亦成立。
- 理论分析表明,DQ估计器利用了处理效应的微小性,实现了有利的偏差-方差权衡,使其在理论和模拟中均占主导地位。
- 该方法引入了三种在强化学习中具有独立兴趣的新技术:ATE的泰勒型展开、修改后的迪尼金恒等式,以及基于扰动的策略评估偏差分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。