[论文解读] Future-Dependent Value-Based Off-Policy Evaluation in POMDPs
该论文提出了一种无需模型的离策略评估(OPE)方法,用于部分可观察的马尔可夫决策过程(POMDPs),通过利用未来和历史观测作为潜在状态的代理,构建依赖未来的价值函数。通过推导一种以历史代理为工具变量的条件矩方程形式的新型离策略贝尔曼方程,并采用极小化-极大化学习方法,该方法在贝尔曼完备性假设下实现了PAC可学习的OPE,有效克服了长时域POMDP中的时域诅咒问题。
We study off-policy evaluation (OPE) for partially observable MDPs (POMDPs) with general function approximation. Existing methods such as sequential importance sampling estimators and fitted-Q evaluation suffer from the curse of horizon in POMDPs. To circumvent this problem, we develop a novel model-free OPE method by introducing future-dependent value functions that take future proxies as inputs. Future-dependent value functions play similar roles as classical value functions in fully-observable MDPs. We derive a new Bellman equation for future-dependent value functions as conditional moment equations that use history proxies as instrumental variables. We further propose a minimax learning method to learn future-dependent value functions using the new Bellman equation. We obtain the PAC result, which implies our OPE estimator is consistent as long as futures and histories contain sufficient information about latent states, and the Bellman completeness. Finally, we extend our methods to learning of dynamics and establish the connection between our approach and the well-known spectral learning methods in POMDPs.
研究动机与目标
- 为解决部分可观察的马尔可夫决策过程(POMDPs)中离策略评估(OPE)的时域诅咒问题,现有方法如序列重要性采样(SIS)和FQE存在误差指数级增长的缺陷。
- 开发一种无需模型的OPE方法,避免对完整历史或不可观测的潜在状态的依赖,从而在长时域、部分可观察的环境中实现实际应用。
- 在贝尔曼完备性假设下建立理论保证——特别是PAC界,假设未来和历史观测包含关于潜在状态的充分信息。
- 通过引入与通用函数逼近器(包括深度神经网络和线性模型)兼容的依赖未来的价值函数,将经典LSTD和拟合Q评估方法推广至POMDPs。
提出的方法
- 提出依赖未来的价值函数,其条件依赖于过去观测(H)和未来观测(F),作为不可观测潜在状态的代理,替代完全可观察MDP中标准的价值函数。
- 推导出适用于POMDPs的新型离策略贝尔曼方程,其形式为条件矩方程,其中历史代理(H)作为工具变量,用于估计价值函数。
- 提出一种极小化-极大化学习框架,通过在函数逼近器上求解鞍点问题来估计依赖未来的价值函数,从而兼容线性模型、再生核希尔伯特空间(RKHS)和深度神经网络。
- 采用两阶段估计程序:首先通过工具变量回归学习价值桥函数;其次应用极小化-极大化优化,以在估计的价值函数上强制满足新推导的贝尔曼方程。
- 在估计过程中使用Moore-Penrose逆,以确保工具变量回归步骤的一致性,特别是在价值桥函数的推导中。
- 将该方法应用于线性和非线性函数逼近设置,基于所提框架将经典LSTD推广至POMDPs。
实验结果
研究问题
- RQ1能否通过避免对完整历史路径的直接依赖,使POMDP中的离策略评估对长时域更具鲁棒性?
- RQ2能否将未来观测用作潜在状态的有效代理,以构建满足POMDP中贝尔曼方程的价值函数?
- RQ3基于条件矩方程与工具变量的极小化-极大化学习方法,能否在POMDP中产生PAC可学习的OPE估计器?
- RQ4在长时域POMDP中,该方法是否在估计误差和样本效率方面优于现有的SIS、SDR和基于FQE的OPE估计器?
主要发现
- 所提出的OPE估计器在贝尔曼完备性假设下实现了PAC可学习性能,其估计误差受依赖未来价值函数近似误差的有界性约束。
- 该方法通过确保估计误差不随有效时域呈指数增长,从而打破了时域诅咒,这与SIS和基于FQE的估计器形成鲜明对比。
- 极小化-极大化学习过程成功学习了满足所推导离策略贝尔曼方程的依赖未来价值函数,即使在部分可观察环境下也表现良好。
- 理论分析表明,在所提框架下,通过工具变量回归推导出的价值桥函数具有一致性,从而支持有效策略评估。
- 数值实验表明,与SIS、SDR和FQE等基线方法相比,该方法在长时域POMDP设置中表现更优,尤其在偏差和方差方面。
- 当使用线性函数逼近时,该方法将经典LSTD推广至POMDPs,为表格方法向部分可观察环境的推广提供了合理扩展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。