Skip to main content
QUICK REVIEW

[论文解读] Importance Resampling for Off-policy Prediction

Matthew Schlegel, Wesley Chung|arXiv (Cornell University)|Jun 11, 2019
Reinforcement Learning in Robotics参考文献 35被引用 4
一句话总结

本文提出重要性重采样(IR),一种新颖的离策略预测方法,用重要性采样比率作为采样权重,从回放缓冲区中进行重采样,替代重要性采样重加权。IR 在表格型和深度强化学习设置下,相较于 IS、WIS 和 V-trace,实现了更低的更新方差和更快的收敛速度,尤其降低了学习率敏感性并提升了样本效率。

ABSTRACT

Importance sampling (IS) is a common reweighting strategy for off-policy prediction in reinforcement learning. While it is consistent and unbiased, it can result in high variance updates to the weights for the value function. In this work, we explore a resampling strategy as an alternative to reweighting. We propose Importance Resampling (IR) for off-policy prediction, which resamples experience from a replay buffer and applies standard on-policy updates. The approach avoids using importance sampling ratios in the update, instead correcting the distribution before the update. We characterize the bias and consistency of IR, particularly compared to Weighted IS (WIS). We demonstrate in several microworlds that IR has improved sample efficiency and lower variance updates, as compared to IS and several variance-reduced IS strategies, including variants of WIS and V-trace which clips IS ratios. We also provide a demonstration showing IR improves over IS for learning a value function from images in a racing car simulator.

研究动机与目标

  • 解决由大重要性采样(IS)比率引起的离策略值函数学习中高方差问题。
  • 探索重采样作为离策略预测中重加权的替代方案,避免在更新中直接乘以极端 IS 比率。
  • 证明在学习前进行重采样可稳定训练过程,并相比基于 IS 的方法提升收敛速度。
  • 在表格型和深度强化学习设置(包括基于图像的控制任务)中评估 IR,以检验其泛化能力和鲁棒性。
  • 在多个环境中,对比 IR 与 IS、WIS 和 V-trace 在方差、学习率敏感性和收敛速度方面的表现。

提出的方法

  • 使用 IS 比率作为采样概率,从回放缓冲区中重采样转移样本:P(s,a) ∝ π(a|s)/μ(a|s)。
  • 对重采样后的转移样本应用标准的同策略更新(例如,TD(0)),避免在更新规则中直接乘以 IS 比率。
  • 采用加权自助法在学习前校正经验分布,确保估计无偏。
  • 提出 IR 的偏差校正变体,以在降低重采样带来的偏差的同时保持一致性。
  • 通过小批量更新和缓冲区管理实现 IR,支持在线学习和可扩展性。
  • 在相同实验设置下,将 IR 与 IS、WIS(含缓冲区和小批量变体)以及 V-trace(采用不同裁剪阈值)进行对比。

实验结果

研究问题

  • RQ1使用 IS 比率作为权重对经验进行重采样,是否能相比标准 IS 和 WIS 显著降低离策略预测中的更新方差?
  • RQ2在表格型和深度强化学习环境中,IR 与 IS 和 V-trace 相比,在学习率敏感性和收敛速度方面表现如何?
  • RQ3IR 是否能在保持一致性和低偏差的同时,通过更少的参数更新次数实现更快收敛?
  • RQ4在 IS 比率较大、方差较高的场景(如基于图像的控制任务)中,IR 是否能提升性能?
  • RQ5在训练初期,IR 更新的方差与 IS 和 WIS 相比如何?

主要发现

  • 在训练初期,IR 的更新方差显著低于 IS 和 WIS,尤其在随机游走马尔可夫链环境中表现明显。
  • 所有方法中,IR 展现出最低的学习率敏感性,其性能稳定性与同策略学习相当。
  • 在 Four Rooms 环境中,IR 比 IS 和 WIS 收敛更快,方差更低,样本效率更高。
  • 在包含图像观测的 TORCs 赛车模拟器中,IR 表现优于 IS 和 V-trace,尤其在高学习率下,表明方差更低。
  • IR 保持了良好的一致性,其偏差与 WIS 相当;偏差校正变体实现了无偏估计。
  • IR 更新的方差在整个训练迭代过程中持续低于 IS,且与学习率敏感性降低和更快收敛呈正相关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。