[论文解读] Off-Policy Evaluation for Action-Dependent Non-Stationary Environments
本文提出 OPEN,一种新颖的离策略评估方法,适用于具有动作相关变化的非平稳环境,通过双重反事实推理与重要性加权工具变量回归,有效降低偏差与方差。该方法在预测未来策略性能方面表现卓越,涵盖主动、被动及混合型非平稳场景,即使在被动场景下也优于以往方法。
Methods for sequential decision-making are often built upon a foundational assumption that the underlying decision process is stationary. This limits the application of such methods because real-world problems are often subject to changes due to external factors (passive non-stationarity), changes induced by interactions with the system itself (active non-stationarity), or both (hybrid non-stationarity). In this work, we take the first steps towards the fundamental challenge of on-policy and off-policy evaluation amidst structured changes due to active, passive, or hybrid non-stationarity. Towards this goal, we make a higher-order stationarity assumption such that non-stationarity results in changes over time, but the way changes happen is fixed. We propose, OPEN, an algorithm that uses a double application of counterfactual reasoning and a novel importance-weighted instrument-variable regression to obtain both a lower bias and a lower variance estimate of the structure in the changes of a policy's past performances. Finally, we show promising results on how OPEN can be used to predict future performances for several domains inspired by real-world applications that exhibit non-stationarity.
研究动机与目标
- 解决在主动、被动或混合型非平稳环境中离策略评估的根本挑战,传统方法因非平稳动态而失效。
- 克服现有离策略评估方法的局限性,这些方法假设平稳性或依赖于遍历性/重置机制,而此类假设在真实世界的长时序数据中不成立。
- 构建统一框架,无需完整模型估计即可推断非平稳环境中的结构化变化,聚焦于策略性能预测。
- 仅使用行为策略的历史数据,在非平稳领域中实现对目标策略未来性能的可靠预测。
- 提供一种无需模型的方法,对超参数选择保持鲁棒性,并能有效处理主动与被动非平稳性。
提出的方法
- 引入高阶平稳性假设:非平稳性随时间演变,但变化机制保持固定,从而支持对结构化变化模式的推断。
- 应用双重反事实推理:首先利用重要性采样生成过去策略性能的去噪估计,随后通过自回归建模预测未来性能。
- 采用两阶段工具变量回归,对重要性采样估计进行去噪,降低过去性能估计的方差,再进行未来性能预测。
- 利用带滞后过去性能的自回归时间序列建模来预测未来性能,使方法对模型误设具有鲁棒性。
- 采用重要性加权回归,校正由动作依赖性非平稳性引起的数据分布偏移,确保在不同策略行为下估计的一致性。
- 设计方法为无模型形式,适用于回合制与持续性设置,避免对重置或稳态分布的假设。

实验结果
研究问题
- RQ1在非平稳环境中,若过去动作影响未来系统动态,是否能实现可靠的离策略评估?
- RQ2如何利用结构化非平稳性(无论被动、主动或混合型)在不完整环境模型估计的前提下预测未来策略性能?
- RQ3在非平稳环境中,双重反事实推理是否能提升估计精度,特别是降低偏差与方差?
- RQ4基于工具变量回归与自回归预测的方法,是否能在被动与主动设置下均优于专为被动非平稳性设计的现有方法?
- RQ5所提出方法对超参数选择的鲁棒性如何,尤其与基于傅里叶的参数化方法相比?
主要发现
- 在所有非平稳领域中,OPEN 在偏差与均方误差(MSE)方面均显著优于 WIS 与 Pro-WLS,包括存在主动与混合型非平稳性的场景。
- 在被动非平稳性场景中,尽管双重反事实校正理论上冗余,OPEN 仍能提供准确预测。
- Pro-WLS 因对傅里叶基底阶数敏感,表现出高偏差与高方差,尤其在项数不足或过多时,导致外推性能差。
- OPEN 的自回归结构采用固定 300 阶滞后,相比 Pro-WLS 的参数化傅里叶回归,对超参数选择更具鲁棒性。
- 消融研究证实,OPEN 在广泛滞后值范围内性能稳定,表明其在预测任务中具备强大泛化能力与可靠性。
- 在每个设置下进行 30 次独立实验,OPEN 在所有领域与非平稳速度下均持续实现低于基线的 MSE 与偏差,证明其统计可靠性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。