[论文解读] Off-policy Evaluation in Infinite-Horizon Reinforcement Learning with Latent Confounders
本文提出了一种新颖的离策略评估方法,用于在存在未观测混杂因素的无限时域强化学习环境中,利用状态和动作作为代理变量来识别策略价值。该方法结合了平稳分布比率估计与最优平衡,无需建模奖励函数即可实现一致的策略价值估计,具有理论保证,并在混杂环境中展现出强劲的实验性能。
Off-policy evaluation (OPE) in reinforcement learning is an important problem in settings where experimentation is limited, such as education and healthcare. But, in these very same settings, observed actions are often confounded by unobserved variables making OPE even more difficult. We study an OPE problem in an infinite-horizon, ergodic Markov decision process with unobserved confounders, where states and actions can act as proxies for the unobserved confounders. We show how, given only a latent variable model for states and actions, policy value can be identified from off-policy data. Our method involves two stages. In the first, we show how to use proxies to estimate stationary distribution ratios, extending recent work on breaking the curse of horizon to the confounded setting. In the second, we show optimal balancing can be combined with such learned ratios to obtain policy value while avoiding direct modeling of reward functions. We establish theoretical guarantees of consistency, and benchmark our method empirically.
研究动机与目标
- 解决在未观测混杂因素存在下,标准离策略评估方法存在偏差的无限时域马尔可夫决策过程中的离策略评估问题。
- 在混杂因素未被观测但状态和动作可作为其代理变量时,从离策略数据中识别策略价值。
- 开发一种避免直接建模奖励函数的方法,同时在独立同分布(i.i.d.)混杂因素假设下确保统计一致性。
- 在混杂环境中,通过实证验证该方法相较于因果与非因果基线方法的性能。
提出的方法
- 在存在未观测混杂因素的情况下,利用代理变量(状态和动作)估计状态的平稳分布比率。
- 通过求解条件矩匹配问题,将无限时域离策略评估技术扩展至存在混杂因素的设置。
- 利用学习到的平稳分布比率,应用最优平衡估计器进行策略价值估计。
- 使用隐变量模型表示状态、动作与混杂因素的联合分布,从而实现策略价值的识别。
- 采用后验噪声注入方法,评估在混杂因素后验估计存在模型误设时的鲁棒性。
- 结合双重稳健估计与基于代理变量的比率学习,以提升估计的稳定性和准确性。
实验结果
研究问题
- RQ1当状态和动作可作为混杂因素的代理变量时,是否可在存在未观测混杂因素的无限时域马尔可夫决策过程中识别策略价值?
- RQ2在存在未观测混杂因素的情况下,如何利用代理变量估计平稳分布比率?
- RQ3在独立同分布(i.i.d.)混杂因素假设及近似i.i.d.设置下,该方法的理论一致性如何?
- RQ4在模型误设与混杂因素后验噪声条件下,该方法与因果及非因果离策略评估基线相比,实证性能如何?
- RQ5最优平衡是否可有效与基于代理变量的比率估计结合,从而避免直接建模奖励函数?
主要发现
- 在独立同分布(i.i.d.)混杂因素假设下,该方法可实现一致的策略价值估计。
- 在接近i.i.d.混杂因素设置下,为该方法建立了理论误差界。
- 实证结果表明,该方法在C-ModelWin与Confounded GridWorld环境中的表现均优于因果与非因果基线方法。
- 通过后验噪声注入实验表明,该方法对混杂因素后验分布的模型误设与噪声具有鲁棒性。
- 双重稳健估计器在后验不确定性下表现出更优的稳定性,优于直接方法在噪声条件下的表现。
- 利用状态-动作代理变量,可在无需显式建模混杂因素的情况下实现策略价值的识别。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。