Skip to main content
QUICK REVIEW

[论文解读] Batch Policy Learning under Constraints

Hoai Minh Le, Cameron Voloshin|arXiv (Cornell University)|Mar 20, 2019
Reinforcement Learning in Robotics参考文献 59被引用 12
一句话总结

本文提出了一种新颖的元算法,用于在多重约束下进行批量策略学习,通过学习归约将问题转化为在线学习和监督学习。它引入了一种新的离策略评估方法,具有PAC风格的界,实现了可证明的约束满足,并在模拟汽车驾驶等高维控制任务中表现出强大的经验性能,同时满足安全性和平顺性约束。

ABSTRACT

When learning policies for real-world domains, two important questions arise: (i) how to efficiently use pre-collected off-policy, non-optimal behavior data; and (ii) how to mediate among different competing objectives and constraints. We thus study the problem of batch policy learning under multiple constraints, and offer a systematic solution. We first propose a flexible meta-algorithm that admits any batch reinforcement learning and online learning procedure as subroutines. We then present a specific algorithmic instantiation and provide performance guarantees for the main objective and all constraints. To certify constraint satisfaction, we propose a new and simple method for off-policy policy evaluation (OPE) and derive PAC-style bounds. Our algorithm achieves strong empirical results in different domains, including in a challenging problem of simulated car driving subject to multiple constraints such as lane keeping and smooth driving. We also show experimentally that our OPE method outperforms other popular OPE techniques on a standalone basis, especially in a high-dimensional setting.

研究动机与目标

  • 解决在现实世界序列决策任务中,从预收集的、非最优的离策略数据中学习有效策略的挑战。
  • 在相互竞争的目标与约束之间进行权衡,例如在自动驾驶中最小化行驶时间的同时确保安全性和舒适性。
  • 在批量学习设置下,为主要目标和约束满足提供理论保证。
  • 开发一种新型、简单的离策略评估技术,具有PAC风格的界,用于验证约束合规性。
  • 在具有多重约束的导航任务和高维赛车任务中,对方法进行经验验证。

提出的方法

  • 该框架使用一种元算法,将约束性批量策略学习问题归约为批量强化学习和在线学习中的子程序。
  • 采用多层学习归约,将约束问题转化为一系列具有性能保证的监督学习和在线学习任务。
  • 提出一种新的离策略评估方法,基于重要性采样并引入一种新颖的校正机制,实现可靠的约束验证。
  • 在高维设置中,使用函数逼近(例如卷积神经网络)进行价值函数和策略函数的估计。
  • 使用指数梯度算法作为子程序,超参数设置为 $ B=10 $,$ \eta = 0.01 $,以优化混合策略。
  • 该算法从多个基础策略构建混合策略,从而在提升主要目标的同时确保稳健的约束满足。

实验结果

研究问题

  • RQ1我们能否从离策略的、非最优的数据中学习到满足多重约束的策略,并具备理论保证?
  • RQ2在无在线交互的情况下,如何验证序列决策中的约束满足?
  • RQ3我们能否通过学习归约和新型OPE技术,在批量强化学习中提升样本效率和约束合规性?
  • RQ4在高维、长时域环境中,所提出的OPE方法与现有技术相比表现如何?
  • RQ5该框架在自动驾驶中平衡速度、安全性和平顺性等相互竞争目标方面,能达到何种程度?

主要发现

  • 所提出的离策略评估方法在高维设置下优于现有技术,得益于更高的稳定性和更低的方差。
  • 该算法在模拟赛车环境中取得了强劲的实验结果,成功满足了车道保持和平顺驾驶的双重约束。
  • 理论分析将非线性函数逼近的样本复杂度界从 $ O(n^4) $ 改进至 $ O(n^2) $,显著提升了数据效率。
  • 在赛车实验中,仅约10%的网格搜索得到的正则化策略同时满足两个约束,而所提方法实现了稳定的约束满足。
  • 混合策略方法确保了混合中各策略始终满足约束,且通常在主要目标上优于数据生成策略。
  • 基于模型的OPE方法(如双重稳健和加权双重稳健)因在高维、长时域领域中动力学建模不准确而失败。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。