Skip to main content
QUICK REVIEW

[论文解读] Towards Neural-Guided Program Synthesis for Linear Temporal Logic Specifications

Alberto Rivas, Sheila A. McIlraith|arXiv (Cornell University)|Dec 31, 2019
Formal Methods in Verification参考文献 24被引用 4
一句话总结

本文提出一种基于神经网络引导的线性时序逻辑(LTL)合成搜索方法,将问题重新表述为使用深度Q-learning引导搜索的优化任务。该方法通过学习Q函数来提升搜索效率,并在小规模LTL规格下成功合成出正确性保证的程序,尽管问题本身具有2EXP-完全复杂度,但仅需极少的训练episode即可实现有效引导。

ABSTRACT

Synthesizing a program that realizes a logical specification is a classical problem in computer science. We examine a particular type of program synthesis, where the objective is to synthesize a strategy that reacts to a potentially adversarial environment while ensuring that all executions satisfy a Linear Temporal Logic (LTL) specification. Unfortunately, exact methods to solve so-called LTL synthesis via logical inference do not scale. In this work, we cast LTL synthesis as an optimization problem. We employ a neural network to learn a Q-function that is then used to guide search, and to construct programs that are subsequently verified for correctness. Our method is unique in combining search with deep learning to realize LTL synthesis. In our experiments the learned Q-function provides effective guidance for synthesis problems with relatively small specifications.

研究动机与目标

  • 为解决精确LTL合成方法的可扩展性限制,其复杂度为2EXP-完全,对大规模问题不切实际。
  • 探索深度强化学习是否能通过从经验中学习Q函数,为LTL合成中的搜索提供有效引导。
  • 结合搜索与深度学习,以超越传统逻辑推理技术的规模扩展合成能力。
  • 评估神经引导在减少搜索空间探索的同时,维持正确性保证的有效性。
  • 研究架构选择(如使用势函数、重用失败对弈、自动机分解)对学习效率和解质量的影响。

提出的方法

  • 将LTL合成重新表述为动态规划问题,以支持基于优化的学习。
  • 使用深度神经网络学习一个Q函数,以估计合成过程中状态-动作对的预期回报。
  • 采用带经验回放和目标网络的深度Q-learning,以稳定训练并提升策略学习效果。
  • 将神经引导集成到启发式搜索框架中,利用Q函数对搜索空间中的潜在路径进行优先排序。
  • 通过引入势函数(即启发式状态值)作为额外奖励信号,增强监督以提升学习性能。
  • 使用自动机分解技术,处理因计算约束而无法转换为单个自动机的大规模LTL公式。

实验结果

研究问题

  • RQ1学习得到的Q函数是否能有效引导LTL合成中的搜索,从而减少对指数级庞大状态空间的穷举探索?
  • RQ2架构增强措施(如使用势函数、重用失败对弈、自动机分解)如何影响基于学习的合成方法的性能与收敛性?
  • RQ3与传统逻辑推理方法相比,神经引导搜索在LTL合成问题上的可扩展性达到何种程度?
  • RQ4神经引导是否能导致生成满足复杂LTL规格的正确性保证程序,且仅需极少训练?
  • RQ5该方法是否能生成紧凑控制器,还是始终产生大于最小解的解?

主要发现

  • 学习得到的Q函数为合成提供了有效引导,使系统能够以相对较少的训练episode解决SYNTCOMP 2019竞赛套件中的多个基准问题。
  • 将势函数作为监督信号显著提升了学习性能,其中DDQS[−, φ]和dec-DDQS[−, φ]配置优于其他设置。
  • 重用失败对弈减少了所需的训练episode数和批量学习步数,加速了收敛。
  • 使用自动机分解虽然增加了输入规模并需要更多训练步数,但相比单个自动机转换,仍保持计算可行性。
  • 该方法生成的控制器显著大于SYNTCOMP 2019中报告的最小控制器,表明策略优化仍有改进空间。
  • 尽管未达到最先进性能,但该方法证明了将深度学习与搜索结合是实现可扩展LTL合成的可行且基础性路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。