[论文解读] Representation Balancing MDPs for Off-Policy Policy Evaluation
该论文提出表示平衡马尔可夫决策过程(RepBM),一种基于模型的离策略策略评估方法,通过使用基于IPM的损失函数平衡表示,最小化有限样本泛化误差。在合成数据和HIV治疗基准测试中,RepBM的均方误差(MSE)显著低于当前最先进方法,尤其在确定性策略设置下的个体策略值估计中表现更优。
We study the problem of off-policy policy evaluation (OPPE) in RL. In contrast to prior work, we consider how to estimate both the individual policy value and average policy value accurately. We draw inspiration from recent work in causal reasoning, and propose a new finite sample generalization error bound for value estimates from MDP models. Using this upper bound as an objective, we develop a learning algorithm of an MDP model with a balanced representation, and show that our approach can yield substantially lower MSE in common synthetic benchmarks and a HIV treatment simulation domain.
研究动机与目标
- 为解决序列决策中行为策略与评估策略显著不同的离策略策略评估(OPPE)挑战。
- 提升个体策略值(IPV)的估计精度,这在医疗保健等个性化应用中至关重要,而不仅仅是平均策略值(APV)。
- 为值估计构建一个理论基础坚实的有限样本泛化误差界,考虑数据分布偏移的影响。
- 设计一种基于模型的OPPE方法,利用该误差界学习对分布偏移具有鲁棒性的表示,尤其适用于确定性评估策略。
- 在均方误差(MSE)方面优于现有基于IS和基于模型的方法,特别是在低重叠和高时序长度设置下。
提出的方法
- 该方法提出了一种新的有限样本泛化误差界,明确考虑了行为策略与评估策略之间在状态表示上的分布偏移。
- 基于该误差界构建损失函数,使用积分概率度量(IPM)来平衡行为策略与评估策略下状态表示的分布。
- 通过最小化行为策略与评估策略在状态表示上的IPM,使模型在评估策略分布上具有更好的泛化能力。
- 该方法应用于确定性评估策略,这在临床决策等现实世界应用中十分常见。
- 使用验证集来调整超参数(如IPM加权系数α),确保在不同领域中均具有鲁棒性能。
- 可与现有基于模型的估计器(如DR和WDR)结合,形成RepBM-DR和RepBM-WDR变体,显著提升基线性能。
实验结果
研究问题
- RQ1基于模型的OPPE方法是否能通过显式考虑状态表示中的分布偏移,实现比现有基于IS和DR的方法更低的有限样本误差?
- RQ2通过IPM实现的表示平衡,相比标准MLE或基于IS的模型,能否显著提升个体策略值的估计精度?
- RQ3IPM超参数α对不同时序长度和策略重叠区域下模型性能的影响如何?
- RQ4在行为策略与评估策略轨迹显著分化的高时序长度设置下,该方法是否仍能保持低误差?
- RQ5在合成环境和真实世界医疗仿真环境中,该方法是否能优于MRDR、WMRDR和PSIS等最先进基线方法?
主要发现
- 在长时序CartPole领域,RepBM在平均策略值上的均方根误差(RMSE)为0.389,在个体策略值上的RMSE为1.023,显著优于IS(149.7和152.2)和PSIS(108.6和2334)。
- 在HIV治疗仿真中,RepBM在平均值上的RMSE为0.248,在个体值上的RMSE为8.075,优于WIS(0.505和93.86)和Soft WIS(0.380和70.55)。
- 该方法对长时序和低策略重叠具有鲁棒性,随着α从0增加到1,性能持续提升,α=1时达到峰值,之后在α=10时开始下降。
- RepBM-DR和RepBM-WDR变体在所有基准测试中均实现了比其基线方法更低的MSE,证明了表示平衡的有效性。
- 消融研究证实,基于IPM的损失至关重要:当α=0(无平衡)时,误差显著升高,尤其在个体值估计中更为明显。
- 该方法优于MRDR、WMRDR和Soft WMRDR,后三者在HIV领域中表现出高方差和不稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。