[论文解读] Combining Parametric and Nonparametric Models for Off-Policy Evaluation
本文提出了一种混合专家(MoE)框架,通过动态结合参数化模型与非参数化模型,以提升强化学习中离策略评估(OPE)的性能。通过估计局部模型误差,并利用规划器在每一步选择最优模型,该方法降低了整体价值估计误差,在多个领域中均优于单一模型及当前最优的重要度采样方法。
We consider a model-based approach to perform batch off-policy evaluation in reinforcement learning. Our method takes a mixture-of-experts approach to combine parametric and non-parametric models of the environment such that the final value estimate has the least expected error. We do so by first estimating the local accuracy of each model and then using a planner to select which model to use at every time step as to minimize the return error estimate along entire trajectories. Across a variety of domains, our mixture-based approach outperforms the individual models alone as well as state-of-the-art importance sampling-based estimators.
研究动机与目标
- 为解决独立参数化与非参数化模型在离策略评估中的局限性,其中参数化模型存在偏差风险,而非参数化模型则受数据稀疏性影响。
- 通过智能结合两类模型的优势,降低离策略评估中价值估计的期望误差。
- 将离策略评估建模为一个规划问题,其中在每一步的模型选择均以最小化累积回报误差为目标。
- 开发用于估计局部模型误差的估计器,以指导规划器在每一步选择最准确的模型。
- 在有限数据环境下,与现有方法相比,证明其一致性和性能提升。
提出的方法
- 该方法采用混合专家(MoE)架构,在每个时间步根据估计的局部误差在参数化模型与非参数化模型之间进行选择。
- 通过真实与预测下一状态之间的欧几里得距离估计局部模型误差,假设动力学为确定性。
- 采用规划算法(如MCTS)选择能最小化总回报估计期望误差的模型序列。
- 规划器利用估计误差进行轨迹级决策,避免仅最小化即时误差的短视选择。
- 该方法在无限数据极限下具有一致性,结合了非参数方法的偏差降低特性与参数化模型的泛化能力。
- 通过将误差估计器修改为比较状态分布而非点预测,该方法可扩展至随机环境。
实验结果
研究问题
- RQ1与单独使用任一模型相比,动态结合参数化与非参数化模型是否能降低离策略价值估计误差?
- RQ2是否基于长期误差的规划型模型选择策略,能优于仅考虑短期误差或静态模型使用策略,从而提升OPE性能?
- RQ3估计的局部模型误差在引导规划器最小化整体回报误差方面,与真实误差相比表现如何?
- RQ4状态空间度量的选择在多大程度上影响不同领域中价值估计的准确性?
- RQ5MoE框架是否能在无限数据极限下保持一致性能,同时在有限数据设置中维持低误差?
主要发现
- 在癌症领域,MoE模型实现了0.020的相对价值估计均方根误差(RMSE),优于参数化模型(0.021)和非参数化模型(0.027)。
- 在HIV领域,MoE模型实现了0.64的RMSE,略优于非参数化模型(0.88),显著优于重要度采样方法(1.0)。
- 当提供真实模型误差时,MoE规划器实现了最低的轨迹模拟误差,证明了误差估计在指导决策方面的有效性。
- 即使无法获取真实误差,引入规划机制仍能降低价值估计误差,表明对误差估计不准确具有鲁棒性。
- 采用规划的MoE方法(MCTS-MoE)在两个领域中均实现了最低RMSE,分别为癌症领域0.019和HIV领域0.63,优于所有基线方法。
- 使用领域适配的度量(如加权欧几里得距离)可进一步提升价值估计性能,尤其在状态维度对奖励影响不均等的领域中效果显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。