[论文解读] A Spectral Approach to Off-Policy Evaluation for POMDPs
本文提出了一种用于部分可观察马尔可夫决策过程(POMDP)的谱方法进行离策略评估,通过利用多步可观测代理变量来放宽先前工作中对严格可逆性的假设。通过扩展过去和未来的历史,并使用特征分解,该方法提高了估计的准确性和泛化能力,同时提出了一种新的重要性采样算法,其条件更弱,不再依赖于充分性假设,而是基于秩、正性和相异性条件。
We consider off-policy evaluation (OPE) in Partially Observable Markov Decision Processes, where the evaluation policy depends only on observable variables but the behavior policy depends on latent states (Tennenholtz et al. (2020a)). Prior work on this problem uses a causal identification strategy based on one-step observable proxies of the hidden state, which relies on the invertibility of certain one-step moment matrices. In this work, we relax this requirement by using spectral methods and extending one-step proxies both into the past and future. We empirically compare our OPE methods to existing ones and demonstrate their improved prediction accuracy and greater generality. Lastly, we derive a separate Importance Sampling (IS) algorithm which relies on rank, distinctness, and positivity conditions, and not on the strict sufficiency conditions of observable trajectories with respect to the reward and hidden-state structure required by Tennenholtz et al. (2020a).
研究动机与目标
- 解决先前用于POMDP离策略评估(OPE)方法的局限性,这些方法依赖于可逆的一步矩矩阵。
- 通过允许更丰富的观测空间(即观测空间大于隐藏状态空间)来提升泛化能力。
- 开发一种估计联合概率而非条件概率的方法,以避免罕见或零概率事件带来的问题。
- 将可观测代理变量扩展至过去和未来轨迹,以减少对强可逆性假设的依赖。
- 基于秩、正性和相异性条件推导一种新的重要性采样算法,避免先前工作中对充分性的严格要求。
提出的方法
- 借鉴PSR和HMM的思想,使用谱分解技术从可观测轨迹中识别潜在状态分布。
- 通过在混淆因子周围扩展历史和未来窗口,构建多步可观测代理变量,以改善秩条件。
- 对矩矩阵(如 $P^r_{i,z_i}$, $Q^r_{i,z_i,z_{i+1}}$)进行特征分解,以在不需矩阵可逆性的前提下识别隐藏状态分布。
- 利用 $P^b(R_{0:H}|U_{0:H})$ 的满秩性质以及可观测联合分布的广义逆(Moore-Penrose逆),识别 $P^b(U_{0:H}| au^o_H)$。
- 基于识别出的权重 $W(v, au^o)$(由 $P^b(r_i|u_i)$, $P^b(u_{0:H}| au^o)$ 和 $ ilde{ ho}_b(u_{0:H})$ 推导)构建新的重要性采样估计器。
- 通过相异性假设(假设10)确保隐藏状态的有序性,从而实现概率估计的正确对齐。
实验结果
研究问题
- RQ1我们能否通过使用多步可观测代理变量,放宽POMDP离策略评估中对一步矩矩阵可逆性的要求?
- RQ2将可观测代理变量扩展至过去和未来轨迹,是否能提升离策略价值估计的可识别性和准确性?
- RQ3我们能否推导出一种新的重要性采样算法,仅依赖于秩、正性和相异性条件,从而避免先前工作中的充分性假设?
- RQ4与现有方法相比,所提出的谱离策略评估估计器在预测准确性和鲁棒性方面的表现如何?
- RQ5该方法在观测空间大于隐藏状态空间的POMDP中,其泛化能力达到何种程度?
主要发现
- 所提出的谱离策略评估方法在预测准确性方面优于先前方法,尤其在高维观测设置下表现更优。
- 通过使用多步历史和未来作为代理变量,该方法放宽了对一步矩矩阵可逆性的需求,增强了在真实POMDP中的适用性。
- 通过估计联合概率而非条件概率,该方法避免了因罕见或零概率条件事件引发的问题。
- 基于特征分解的识别过程在弱于先前工作的假设下,实现了对 $P^b(r_i|u_i)$ 和 $P^b(u_{0:H}| au^o_H)$ 的一致估计。
- 新的重要性采样算法在秩、正性和相异性条件下具有可识别性,避免了Tennenholtz等人(2020a)所要求的严格充分性假设。
- 实证验证表明,扩展的代理方法在多个环境中均能产生更稳定和准确的离策略评估估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。