[论文解读] Black-box Off-policy Estimation for Infinite-Horizon Reinforcement Learning
本文提出了一种用于无限时域强化学习的黑箱离策略估计算法,通过将问题建模为求解后向流算子的不动点方程,避免了对已知行为策略或平稳离策略数据的依赖。利用再生核希尔伯特空间(RKHS),该方法可直接从数据中非参数估计平稳分布的重要性比率,实现了渐近一致性与有限样本泛化能力,实验表明即使在数据非平稳的情况下,其性能也优于以往方法。
Off-policy estimation for long-horizon problems is important in many real-life applications such as healthcare and robotics, where high-fidelity simulators may not be available and on-policy evaluation is expensive or impossible. Recently, \cite{liu18breaking} proposed an approach that avoids the \emph{curse of horizon} suffered by typical importance-sampling-based methods. While showing promising results, this approach is limited in practice as it requires data be drawn from the \emph{stationary distribution} of a \emph{known} behavior policy. In this work, we propose a novel approach that eliminates such limitations. In particular, we formulate the problem as solving for the fixed point of a certain operator. Using tools from Reproducing Kernel Hilbert Spaces (RKHSs), we develop a new estimator that computes importance ratios of stationary distributions, without knowledge of how the off-policy data are collected. We analyze its asymptotic consistency and finite-sample generalization. Experiments on benchmarks verify the effectiveness of our approach.
研究动机与目标
- 解决现有离策略估计算法在长时域强化学习中对已知行为策略和平稳数据分布的依赖问题。
- 开发一种方法,使在行为策略未知且数据在长时间内非平稳收集的真实世界场景中,实现准确的离策略评估。
- 将离策略估计建模为涉及后向流算子的不动点问题,实现对时域依赖的鲁棒估计。
- 为所提出的估计器提供渐近一致性和有限样本泛化能力的理论保证。
- 在行为策略未知且数据非平稳的条件下,通过实验验证该方法在经典控制基准测试中的有效性。
提出的方法
- 该方法将离策略估计建模为求解后向流算子的不动点,这与标准的前向贝尔曼算子不同。
- 利用再生核希尔伯特空间(RKHS)非参数估计平稳分布的重要性比率,而无需了解行为策略。
- 该估计器基于离策略数据计算状态的重要性权重,即使数据来自未知或多个行为策略也能适用。
- 通过操作于平稳分布比率而非轨迹级权重,避免了传统重要性采样方法的指数级方差增长。
- 采用参数化模型(前馈神经网络)表示不动点函数,并在数据子集上调整超参数,以确保在不同样本规模下的鲁棒性。
- 理论分析在较弱正则性条件下建立了渐近一致性和有限样本泛化界。
实验结果
研究问题
- RQ1在无限时域强化学习中,是否可以在不依赖行为策略知识的情况下实现准确的离策略估计?
- RQ2当离策略数据尚未达到平稳分布时,该方法是否仍具有效能?
- RQ3与现有方法相比,该RKHS中的不动点公式在偏差、方差以及对数据分布漂移的鲁棒性方面表现如何?
- RQ4在现实世界中非平稳的数据采集条件下,该估计器的有限样本泛化性能如何?
- RQ5在具有长时域动态特性且行为策略未知的基准测试中,该方法是否优于现有方法?
主要发现
- 在四个控制基准测试中的三个(Pendulum、Mountain Car、CartPole)中,该方法在RMSE指标上优于基线方法(包括朴素平均和IPS),即使在数据非平稳的情况下也表现更优。
- 在Acrobot上,该方法与IPS性能相当,表明其在多样化环境中的鲁棒性。
- 该方法在不同轨迹数量下均保持一致的性能表现,显示出对数据规模变化的强鲁棒性,且无需重新调整超参数。
- 中位数与四分位距结果(图3)证实,性能趋势稳定,且对异常值的敏感性低于对比方法。
- 该方法在RMSE上优于以往需要已知行为策略或平稳数据的方法,验证了其黑箱特性与实际应用潜力。
- 实验表明,即使行为策略未知且数据来自多个未观测到的流程(如真实世界观察数据),该方法仍保持有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。