[论文解读] The 5th Reactive Synthesis Competition (SYNTCOMP 2018): Benchmarks, Participants & Results.
本文报告了第五届反应式合成竞赛(SYNTCOMP 2018)的结果,引入了四个新的基准类别——时序流逻辑(TSL)、硬件组件、井字棋游戏以及基于抽象的控制——并针对LTL合成与可实现性两个赛道对14款工具进行了全面评估。STRIX在所有官方类别中均获第一,其组合配置在并行模式下解决了272个实例中的256个,并生成了高质量、紧凑的策略;而BoWSer(opt,par)在所有工具中实现了最高的平均解决方案质量。
We report on the fifth reactive synthesis competition (SYNTCOMP 2018). We introduce four new benchmark classes that have been added to the SYNTCOMP library, and briefly describe the evaluation scheme and the experimental setup of SYNTCOMP 2018. We give an overview of the participants of SYNTCOMP 2018 and highlight changes compared to previous years. Finally, we present and analyze the results of our experimental evaluation, including a ranking of tools with respect to quantity and quality of solutions.
研究动机与目标
- 评估并比较反应式合成工具在标准化、持续演进的基准套件上的性能与质量。
- 评估LTL与安全性质可缩放且用户友好的合成技术的进展。
- 识别在解决方案质量、可扩展性与正确性方面表现领先的工具及其配置。
- 引入反映函数式响应编程(FRP)、硬件、游戏与控制系统中真实世界合成挑战的新基准类别。
- 为反应式合成研究维护一个公开、一致且可复现的评估平台。
提出的方法
- 竞赛使用了以TLSF格式表示的标准化基准库,包含4个新基准类别的272个LTL合成实例。
- 工具在两个赛道上接受评估:可实现性检查与合成,分别在串行与并行执行模式下进行,超时时间为3600秒。
- 通过模型检测验证解决方案的正确性,解决方案质量通过相对于参考解的AIGER电路大小进行度量。
- 采用双轨排名系统:一是基于解决实例数量的排名,二是基于解决方案大小(质量排名)的排名。
- 实验设置包括在共享集群上自动执行,对多种配置下的工具进行正确性与性能测试。
- 基准集包含来自函数式响应编程(FRP)、硬件电路、游戏与控制系统等领域的参数化与非参数化示例。
实验结果
研究问题
- RQ1当前反应式合成工具在多样化且不断扩展的LTL合成基准集上的表现如何?
- RQ2哪些工具配置在电路大小方面实现了最高的解决方案质量?其影响因素是什么?
- RQ3与串行执行相比,并行执行模式在提升可扩展性与解决方案覆盖范围方面有多大改善?
- RQ4引入新基准类别(如TSL与基于抽象的控制)对现有合成工具构成了何种挑战?
- RQ5不同的合成策略(如有界合成、组合配置、最小化标签 vs. 标签数量)对解决方案质量与性能有何影响?
主要发现
- STRIX在LTL合成赛道的所有官方类别中均获第一,在并行模式下解决了272个实例中的256个,并在所有配置中实现了最高的质量得分。
- STRIX(组合配置)解决的实例数比最佳串行配置少一个,但显著提升了解决方案质量,在质量排名中优于其他工具。
- BoWSer(opt,par)在所有已解决实例中实现了最高的平均解决方案质量,其中54个解决方案优于先前的参考解。
- ltlsynt生成的解决方案普遍大于BoSy与BoWSer,多数情况下其解决方案大小约为BoSy的十倍。
- 无任何工具产生错误解决方案,不同工具在6至23个实例中出现模型检测超时,表明存在可扩展性挑战。
- 包含基于抽象控制示例的新基准集因翻译时间过长而未纳入竞赛,但已作为未来研究的挑战基准发布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。