Skip to main content
QUICK REVIEW

[论文解读] Learning Heuristics for Quantified Boolean Formulas through Deep Reinforcement Learning

Gil Lederman, Markus N. Rabe|arXiv (Cornell University)|Jul 20, 2018
Machine Learning and Algorithms参考文献 47被引用 8
一句话总结

本文提出一种深度强化学习方法,用于自动学习量化布尔公式的(QBF)求解器的优越分支启发式策略,通过将图神经网络(GNN)集成到CADET求解器中,提升性能。通过将启发式选择建模为强化学习问题,该方法将整体求解时间减少了一个数量级,并解决了比现有手工编写启发式策略多得多的公式。

ABSTRACT

We demonstrate how to learn efficient heuristics for automated reasoning algorithms for quantified Boolean formulas through deep reinforcement learning. We focus on a backtracking search algorithm, which can already solve formulas of impressive size - up to hundreds of thousands of variables. The main challenge is to find a representation of these formulas that lends itself to making predictions in a scalable way. For a family of challenging problems, we learned a heuristic that solves significantly more formulas compared to the existing handwritten heuristics.

研究动机与目标

  • 为解决手动设计有效QBF求解器启发式策略的挑战,这些启发式策略对性能至关重要但难以设计。
  • 探索将深度学习与形式推理算法结合,以提升可扩展性并解决此前难以处理的问题。
  • 开发一种强化学习框架,直接从QBF实例的求解器行为中学习分支启发式策略。
  • 通过使用能独立生成并验证形式证明的求解器,确保正确性。
  • 克服神经网络引导求解器中表示、无界动作空间、长episode长度和高推理开销等挑战。

提出的方法

  • 该方法利用合取范式(CNF)结构将QBF表示为图,从而为图神经网络(GNN)提供合适的输入表示。
  • 通过深度强化学习训练基于GNN的策略网络,以在回溯搜索过程中选择分支决策(变量和取值)。
  • 学习环境基于CADET,一个开源QBF求解器,能够生成形式证明以验证正确性。
  • 强化学习智能体根据求解时间以及成功/失败结果接收稀疏奖励,以鼓励更快且正确的求解。
  • 该方法采用课程学习策略,先在相似公式上进行训练,再推广到新公式,从而提高样本效率。
  • 为降低推理开销,模型保持小型化并针对低延迟决策进行优化,尽管神经网络推理本身存在成本。

实验结果

研究问题

  • RQ1与手工编写启发式策略相比,深度强化学习能否有效学习到更好的QBF求解器分支启发式策略?
  • RQ2如何训练神经网络在具有无界动作空间(由于变量数量)且episode长度可变的求解器中做出决策?
  • RQ3基于GNN的策略能否在保持低推理开销的同时,泛化到多样化的QBF实例?
  • RQ4将神经策略集成到最先进的求解器中是否能提升整体求解性能和可扩展性?
  • RQ5当强化学习智能体可能利用实现中的错误而非真正解决问题时,如何确保正确性?

主要发现

  • 所学习的启发式策略将CADET求解器在QBF公式基准集上的平均求解时间减少了10倍。
  • 该方法解决的公式数量显著多于基线手工编写启发式策略,尤其在一类具有挑战性的QBF实例上表现突出。
  • 尽管单次决策的推理成本较高,但决策质量的提升完全补偿了这一代价,实现了整体性能增益。
  • 出人意料的是,更大的神经网络并未提升性能,表明小型高效模型已足以实现有效的启发式学习。
  • 将GNN策略集成到CADET中,使得能够生成并验证形式证明,确保了所有结果的正确性。
  • 该方法在未见过的公式上表现出强大的泛化能力,表明所学习的启发式策略捕捉到了QBF中具有意义的结构模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。