Skip to main content
QUICK REVIEW

[论文解读] Instrumental Variable Value Iteration for Causal Offline Reinforcement Learning

Luofeng Liao, Zuyue Fu|arXiv (Cornell University)|Feb 19, 2021
Reinforcement Learning in Robotics参考文献 57被引用 8
一句话总结

该论文提出IVVI,一种可证明高效的离线强化学习算法,利用工具变量(IVs)在存在未观测混杂因素的情况下识别因果转移动态。通过在加法型未观测混杂因素假设下建立条件矩约束(CMR),并采用原始-对偶优化求解,IVVI实现了样本复杂度为$O(\mu_{\text{IV}}^{-4}\mu_B^{-2.5}H^4d_x\epsilon^{-2})$的$\epsilon$-最优策略,这是首个针对IV辅助离线强化学习的此类结果。

ABSTRACT

In offline reinforcement learning (RL) an optimal policy is learned solely from a priori collected observational data. However, in observational data, actions are often confounded by unobserved variables. Instrumental variables (IVs), in the context of RL, are the variables whose influence on the state variables is all mediated by the action. When a valid instrument is present, we can recover the confounded transition dynamics through observational data. We study a confounded Markov decision process where the transition dynamics admit an additive nonlinear functional form. Using IVs, we derive a conditional moment restriction through which we can identify transition dynamics based on observational data. We propose a provably efficient IV-aided Value Iteration (IVVI) algorithm based on a primal-dual reformulation of the conditional moment restriction. To our knowledge, this is the first provably efficient algorithm for instrument-aided offline RL.

研究动机与目标

  • 解决在动作受未观测变量混杂时,从离线观测数据中学习最优策略的挑战。
  • 开发一种方法,在存在未观测混杂因素的情况下,利用工具变量识别因果转移动态。
  • 提出一种在受混杂数据影响下,利用IVs实现可证明高效的离线强化学习算法。
  • 建立首个针对IV辅助离线强化学习算法的样本复杂度边界。
  • 在实验成本高昂或伦理上不可接受的医疗等领域,实现安全、数据驱动的策略学习。

提出的方法

  • 构建一个带有工具变量的受混杂马尔可夫决策过程(CMDP-IV),以建模存在未观测混杂因素的序列决策问题。
  • 推导出一个条件矩约束(CMR),通过有效工具变量实现对转移动态的点识别。
  • 将CMR重新表述为原始-对偶优化问题,以同时保证计算效率和统计效率。
  • 提出IV辅助值迭代(IVVI)算法,通过随机梯度步骤迭代更新值函数和对偶变量。
  • 采用基于模型的方法,基于加法型未观测混杂因素假设下的IV矩条件估计转移动态。
  • 使用对偶特征空间,确保IV与函数逼近之间的兼容性,其量化指标为$\mu_B$,即对偶特征协方差矩阵的最小特征值。

实验结果

研究问题

  • RQ1我们能否仅通过观测数据和有效工具变量,在受混杂的MDP中识别出真实的转移动态?
  • RQ2是否可能设计一种可证明高效的离线强化学习算法,利用工具变量缓解未观测混杂因素的影响?
  • RQ3在存在未观测混杂因素的情况下,利用IVs恢复$\epsilon$-最优策略所需的样本复杂度是多少?
  • RQ4工具变量的强度($\mu_{\text{IV}}$)和对偶特征空间的兼容性($\mu_B$)如何影响学习效率?
  • RQ5原始-对偶优化框架能否有效用于求解基于IV识别在离线强化学习中产生的条件矩约束?

主要发现

  • IVVI算法在样本复杂度$O(\mu_{\text{IV}}^{-4}\mu_B^{-2.5}H^4d_x\epsilon^{-2})$下实现了$\epsilon$-最优策略,这是首个针对IV辅助离线强化学习的此类边界。
  • 在加法型未观测混杂因素假设下推导出的条件矩约束(CMR)能够从观测数据中实现对真实转移动态的点识别。
  • 对CMR的原始-对偶重构确保了估计过程中统计效率与计算效率的双重保障。
  • 在满足平滑性和目标函数强凸性等温和正则性条件下,该算法的收敛性可得到保证。
  • 样本复杂度随工具变量强度($\mu_{\text{IV}}$)和对偶特征空间兼容性($\mu_B$)的提升而有利地降低,表明对弱工具变量和特征对齐不佳具有鲁棒性。
  • 实证验证得到理论保证的支持,包括估计误差边界和值函数更新的收敛速率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。