Skip to main content
QUICK REVIEW

[论文解读] Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement Learning

Nathan Kallus, Angela Zhou|arXiv (Cornell University)|Feb 11, 2020
Reinforcement Learning in Robotics参考文献 40被引用 12
一句话总结

本文提出了一种在存在未观测混杂因素的无限时域强化学习中,针对反事实评估的稳健方法。通过在敏感性模型约束下对平稳状态占据比率进行优化,计算策略价值的紧致边界,采用非凸投影梯度下降法实现可计算的近似,并证明了随着数据量增加,收敛至真实边界的性质。

ABSTRACT

Off-policy evaluation of sequential decision policies from observational data is necessary in applications of batch reinforcement learning such as education and healthcare. In such settings, however, unobserved variables confound observed actions, rendering exact evaluation of new policies impossible, i.e., unidentifiable. We develop a robust approach that estimates sharp bounds on the (unidentifiable) value of a given policy in an infinite-horizon problem given data from another policy with unobserved confounding, subject to a sensitivity model. We consider stationary or baseline unobserved confounding and compute bounds by optimizing over the set of all stationary state-occupancy ratios that agree with a new partially identified estimating equation and the sensitivity model. We prove convergence to the sharp bounds as we collect more confounded data. Although checking set membership is a linear program, the support function is given by a difficult nonconvex optimization problem. We develop approximations based on nonconvex projected gradient descent and demonstrate the resulting bounds empirically.

研究动机与目标

  • 解决在未观测混杂因素导致策略价值不可识别的观察性强化学习设置中,反事实评估的挑战。
  • 开发一种方法,在未观测混杂导致部分识别的情况下,计算策略价值的最紧致边界。
  • 通过提供对敏感性敏感的值估计,确保策略学习的可信度与安全性,基于混杂数据。
  • 在实验成本高昂或伦理上不可行的高风险领域(如医疗保健和教育)中实现实际应用。
  • 弥合无混淆反事实评估技术与存在隐藏混杂因素的序列决策中部分识别之间的差距。

提出的方法

  • 在无限时域马尔可夫决策过程(MDP)中,形式化一个部分识别的估计方程,纳入对未观测混杂因素的敏感性模型。
  • 通过优化所有与估计方程和敏感性模型一致的平稳状态占据比率,推导出策略价值的边界。
  • 使用非凸投影梯度下降法,近似计算边界所需困难的支持函数优化。
  • 在表格情形中采用重参数化技巧以降低计算负担,但在函数逼近设置中仍面临挑战。
  • 针对线性函数逼近中的模型误设问题,引入可行性松弛,尽管这可能导致边界变松。
  • 使用一个带有未观测混杂因素的3×3网格世界环境,结合不同敏感性参数,对方法进行实证验证。

实验结果

研究问题

  • RQ1当观测数据受未观测状态混杂时,能否计算目标策略价值的紧致边界?
  • RQ2如何在保持计算可及性的同时,确保这些边界对未观测混杂因素具有鲁棒性?
  • RQ3哪些优化技术能有效近似边界计算所需的非凸支持函数?
  • RQ4在函数逼近设置中,模型误设情况下该方法的可扩展性与性能如何?
  • RQ5随着数据量增加,这些边界在多大程度上仍具信息量且稳定?

主要发现

  • 随着混杂数据量的增加,所提方法收敛至策略价值的紧致边界,确保渐近有效性。
  • 在3×3网格世界上的实证结果表明,边界在一系列敏感性参数下保持信息量丰富,Γ值范围为1.10至5.47,共25个取值。
  • 非凸投影梯度下降提供了稳定且有效的近似策略,尤其在结合单调性与解缓存机制时效果更佳。
  • 通过Gurobi进行全局优化验证了投影梯度方法的可靠性,实际性能差距极小。
  • 该方法在标准硬件(如配备16GB内存的MacBook Pro)上对中等规模问题仍保持计算可行性。
  • 虽然SDP松弛方法在理论上有效,但其扩展性极差(复杂度为O(|S|⁹|A|⁹/²)),在实际应用中不可行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。