[论文解读] Offline Reinforcement Learning with Instrumental Variables in Confounded Markov Decision Processes
该论文提出了一种基于工具变量(IVs)的离线强化学习方法,用于处理存在未观测混杂因素的马尔可夫决策过程(confounded MDPs),以应对未观测混杂因素和数据覆盖有限的问题。通过利用基于IV的值函数识别与广义重要性采样(marginalized importance sampling),并结合悲观性原则,该方法在最小假设下实现了$O(\log(NT)(NT)^{-1/2})$的有限样本次优性界,即使在非独立同分布(i.i.d.)或非平稳数据条件下也成立。
We study the offline reinforcement learning (RL) in the face of unmeasured confounders. Due to the lack of online interaction with the environment, offline RL is facing the following two significant challenges: (i) the agent may be confounded by the unobserved state variables; (ii) the offline data collected a prior does not provide sufficient coverage for the environment. To tackle the above challenges, we study the policy learning in the confounded MDPs with the aid of instrumental variables. Specifically, we first establish value function (VF)-based and marginalized importance sampling (MIS)-based identification results for the expected total reward in the confounded MDPs. Then by leveraging pessimism and our identification results, we propose various policy learning methods with the finite-sample suboptimality guarantee of finding the optimal in-class policy under minimal data coverage and modeling assumptions. Lastly, our extensive theoretical investigations and one numerical study motivated by the kidney transplantation demonstrate the promising performance of the proposed methods.
研究动机与目标
- 解决离线强化学习中未观测混杂因素带来的挑战,这些因素会破坏标准的无混杂性假设。
- 克服离线强化学习中对数据覆盖范围的严格假设,尤其是在状态空间或动作空间较大的情况下。
- 利用工具变量在观测数据中识别因果效应,实现对存在混杂因素的MDPs的策略学习。
- 开发一种理论基础坚实的算法,其在最小化模型和覆盖假设下具备有限样本次优性保证。
- 在不依赖i.i.d.或平稳数据的前提下实现对最优策略的收敛,从而扩大在真实世界场景中的适用性。
提出的方法
- 通过工具变量建立基于值函数(VF)的识别方法,推导出无限时域混杂MDP的新贝尔曼方程。
- 开发基于广义重要性采样(MIS)的识别方法,直接利用IVs估计期望总奖励$J(\pi)$。
- 通过结合IVs和悲观性原则的估计方程,构建状态值函数的极小极大估计器。
- 基于其损失函数构建该极小极大估计器的置信集,无需对估计器施加一致带宽要求。
- 利用悲观性原则,通过在置信集中最大化对期望总奖励的最保守估计来选择最优策略。
- 通过结合VF-和MIS-识别方法,提出一种双重稳健估计器,提升对模型误设的鲁棒性。
实验结果
研究问题
- RQ1能否仅使用有限时域观测数据,利用工具变量识别混杂MDPs中的值函数和期望总奖励?
- RQ2如何将悲观性与基于IV的识别相结合,以在弱数据覆盖条件下确保离线强化学习的有限样本次优性保证?
- RQ3当数据非i.i.d.或非平稳时,所提方法的理论收敛性质如何?
- RQ4结合VF-和MIS-识别方法是否能比单独使用任一方法获得更鲁棒、更准确的策略学习方法?
- RQ5在存在未观测混杂因素和有限数据覆盖的情况下,所提方法是否能优于标准离线强化学习方法?
主要发现
- 所提方法实现了$O(\log(NT)(NT)^{-1/2})$的有限样本次优性界,用于寻找类内最优策略,且当$N$或$T$增大时该界趋于零。
- 该方法不要求数据为i.i.d.或来自平稳分布,而是依赖于对几何遍历序列的新颖集中不等式。
- 数值结果表明,悲观的IV方法(pess_IV)在学习优于行为策略的策略方面显著优于所有基线方法,包括非悲观和非IV方法。
- 与no_pess_IV相比,pess_IV方法实现了更高且更稳定的期望总奖励,证明了结合悲观性与IVs的优势。
- 不使用IVs的方法(pess_no_IV和no_pess_no_IV)无法超越行为策略,凸显了在存在混杂因素时使用IVs的必要性。
- 双重稳健估计器结合了VF-和MIS-识别方法的优势,在模型误设条件下提供了更优的鲁棒性和性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。