Skip to main content
QUICK REVIEW

[论文解读] Towards Mixed Optimization for Reinforcement Learning with Program Synthesis

Surya Bhupatiraju, Kumar Krishna Agrawal|arXiv (Cornell University)|Jul 1, 2018
Reinforcement Learning in Robotics参考文献 13被引用 3
一句话总结

本文提出 Morl,一种混合优化框架,通过从黑箱策略中合成符号程序、针对安全性和性能约束进行修复,并将修复后的程序提炼回神经策略以进行进一步的基于梯度的优化,从而迭代地改进深度强化学习策略。该方法实现了更快的收敛速度和更高的样本效率,在 CartPole 上经微调后平均回报达到 176.8,优于未经修改策略的 38.65。

ABSTRACT

Deep reinforcement learning has led to several recent breakthroughs, though the learned policies are often based on black-box neural networks. This makes them difficult to interpret and to impose desired specification constraints during learning. We present an iterative framework, MORL, for improving the learned policies using program synthesis. Concretely, we propose to use synthesis techniques to obtain a symbolic representation of the learned policy, which can then be debugged manually or automatically using program repair. After the repair step, we use behavior cloning to obtain the policy corresponding to the repaired program, which is then further improved using gradient descent. This process continues until the learned policy satisfies desired constraints. We instantiate MORL for the simple CartPole problem and show that the programmatic representation allows for high-level modifications that in turn lead to improved learning of the policies.

研究动机与目标

  • 解决黑箱深度强化学习策略的局限性,这些策略难以解释、调试或在保证安全的前提下进行约束。
  • 通过将符号程序合成与修复集成到训练循环中,实现对策略学习的高层级修改。
  • 通过利用符号表示进行策略精炼,提升样本效率与收敛速度。
  • 提供一个支持迭代式、人工或机器辅助的符号形式策略修复与再训练的框架。
  • 在标准控制基准 CartPole 上验证该方法的可行性与优势。

提出的方法

  • 使用领域特定语言(DSL)从训练好的深度强化学习策略中合成符号程序,灵感来自 Pirl 和 Viper。
  • 对符号程序执行程序修复——可手动或自动进行——以满足期望的约束,如安全性或行为改进。
  • 使用行为克隆(模仿学习)将修复后的符号程序提炼为可微的神经策略。
  • 应用基于梯度的策略优化(如 TRPO)进一步精炼提炼后的策略。
  • 迭代该过程:策略 → 程序 → 修复后的程序 → 提炼策略 → 改进后的策略,形成闭环精炼循环。
  • 使用简单的 CartPole DSL 实例化该框架,并通过受控实验验证其有效性。

实验结果

研究问题

  • RQ1深度强化学习策略的符号程序表示是否能实现更有效且可解释的策略改进?
  • RQ2在符号空间中修复策略是否能加快后续训练的收敛速度并提升样本效率?
  • RQ3以程序修复形式编码的高层级人工洞察是否能显著提升从较差初始化出发的策略性能?
  • RQ4与标准端到端强化学习相比,程序合成与修复的集成在收敛速度与最终性能方面表现如何?
  • RQ5符号表示在多大程度上能够支持可验证且安全的强化学习策略学习?

主要发现

  • 最差初始化的策略在 25 次运行中平均回报为 9.28,表明其从较差起点出发性能极差。
  • 经过程序修复与提炼后,中间策略在 15,000 次训练周期后平均回报达到 66,表现显著提升。
  • 接近最优的修复程序导致提炼策略在 15,000 次周期后平均回报达到 185,证明了符号修复的有效性。
  • 经过 TRPO 微调 25 个周期后,源自接近最优程序的策略平均回报达到 176.8,优于基线超过 3 倍。
  • 当从修复后的符号策略初始化时,TRPO 训练过程收敛速度显著加快,验证了符号洞察可加速学习的假设。
  • 该框架成功证明,符号空间中的迭代修复能够实现更快收敛至近似最优策略,尤其在初始化较差时效果显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。