[论文解读] Towards Safe Policy Improvement for Non-Stationary MDPs
本文提出 SPIN,一种用于非平稳马尔可夫决策过程(NS-MDP)中安全策略改进的 Seldonian 强化学习算法,其中环境动态随时间平稳变化。通过结合无模型强化学习、时间序列分析以及使用野生自展法置信区间的序列假设检验,SPIN 确保所提出的策略不会使性能低于已知的安全策略,在不建模完整 NS-MDP 的情况下实现高置信度的安全性。
Many real-world sequential decision-making problems involve critical systems with financial risks and human-life risks. While several works in the past have proposed methods that are safe for deployment, they assume that the underlying problem is stationary. However, many real-world problems of interest exhibit non-stationarity, and when stakes are high, the cost associated with a false stationarity assumption may be unacceptable. We take the first steps towards ensuring safety, with high confidence, for smoothly-varying non-stationary decision problems. Our proposed method extends a type of safe algorithm, called a Seldonian algorithm, through a synthesis of model-free reinforcement learning with time-series analysis. Safety is ensured using sequential hypothesis testing of a policy's forecasted performance, and confidence intervals are obtained using wild bootstrap.
研究动机与目标
- 解决现实世界中高风险的非平稳序列决策问题中强化学习缺乏安全保证的问题。
- 形式化平稳变化的非平稳 MDP(NS-MDP)中的安全策略改进问题,其中底层动态随时间变化。
- 开发一种算法,确保所提出的策略即使在环境非平稳的情况下,也不会比已知的安全策略表现更差。
- 提供用户可调节的置信度控制旋钮,将部署更差策略的概率限制在期望阈值以内。
- 避免对完整 NS-MDP 进行显式建模,这在实际中通常不可行。
提出的方法
- 通过使用序列假设检验将候选策略的预测性能与已知安全策略进行比较,将 Seldonian 算法扩展至非平稳设置。
- 采用野生自展法重采样以构建未来性能估计的置信区间,从而在非平稳条件下实现稳健的统计推断。
- 通过过去回报的时间序列建模进行反事实性能估计,以预测策略的未来性能趋势。
- 使用重要性采样进行离策略评估,尽管承认其可能存在高方差。
- 实施策略改进循环,仅当候选策略在置信区间内统计上优于安全策略时才进行更新。
- 使用不同维度的傅里叶基函数建模性能趋势,并对近似精度进行敏感性分析。
实验结果
研究问题
- RQ1我们能否在环境动态随时间平稳变化的非平稳 MDP 中,确保策略改进的高置信度安全性?
- RQ2我们如何在不显式建模底层非平稳 MDP 的情况下,维持安全保证?
- RQ3我们能否设计一种方法,确保所提出的策略即使在非平稳条件下,也不会比已知的安全策略表现更差?
- RQ4在实际、现实场景中,安全保证对超参数选择的鲁棒性如何?
- RQ5在非平稳条件下,使用野生自展法置信区间在性能估计中在多大程度上提升了可靠性?
主要发现
- SPIN 在推荐系统(RecoSys)和糖尿病治疗两个领域中均成功维持了安全性,如图 4 左下角图所示,极少见地发生了不安全策略部署。
- 在两个领域中,该方法均显著优于基线安全策略,如图 4 中上中和上右图所示,归一化改进始终高于零。
- 即使在广泛且现实的超参数范围内变化时,SPIN 仍保持安全,表明其对用户配置具有鲁棒性。
- 尽管使用了以重要性采样,而该方法已知存在高方差,但通过使用野生自展法进行置信区间估计,算法的安全保证依然成立。
- 即使真实性能趋势无法被精确建模(例如,由于傅里叶基函数维度有限),该方法仍表现出有效性,表明其在模型误设情况下的实际适用性。
- 评估过程通过将非安全策略的回报样本均值与安全策略的回报进行比较(按部署频率加权),正确识别出不安全的部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。