[论文解读] Reproduction Report for SV-COMP 2023
本文报告了对 SV-COMP 2023 的可复现性研究,该赛事是大规模软件验证竞赛。利用赛事官方提供的资料和基础设施,作者对代表性基准测试子集进行了重新运行,发现由于运行时波动导致得分出现轻微变化,但工具排名未发生改变,证实了在相同实验设置下赛事结果具有可复现性。
The Competition on Software Verification (SV-COMP) is a large computational experiment benchmarking many different software verification tools on a vast collection of C and Java benchmarks. Such experimental research should be reproducible by researchers independent from the team that performed the original experiments. In this reproduction report, we present our recent attempt at reproducing SV-COMP 2023: We chose a meaningful subset of the competition and re-ran it on the competition organiser's infrastructure, using the scripts and tools provided in the competition's archived artifacts. We see minor differences in tool scores that appear explainable by the interaction of small runtime fluctuations with the competition's scoring rules, and successfully reproduce the overall ranking within our chosen subset. Overall, we consider SV-COMP 2023 to be reproducible.
研究动机与目标
- 通过独立执行,评估 SV-COMP 2023 大规模软件验证竞赛的可复现性。
- 评估赛事结果(尤其是工具排名)是否可由外部团队可靠复现。
- 识别得分波动的潜在来源,并评估其对赛事结果公平性和可信度的影响。
- 评估复现大规模工具竞赛的实际可行性,并为未来改进可复现性提供建议。
- 探究对部分基准测试进行抽样检查是否可作为评估整个赛事可复现性的有效代理。
提出的方法
- 选取 SV-COMP 2023 的代表性基准测试子集和类别进行重新执行,重点关注并发安全(ConcurrencySafety)、Java 总体(JavaOverall)和软件系统(SoftwareSystems)等关键类别。
- 使用官方归档资料中提供的原始脚本、工具和基准测试集重新执行赛事。
- 在与原始赛事相同的基础设施(168 台机器的集群)和配置下运行子集,该基础设施由慕尼黑大学(LMU Munich)托管。
- 将重新执行的工具得分和排名与原始 SV-COMP 2023 结果进行对比,以评估可复现性。
- 分析原始结果数据(.csv 文件),调查得分差异,特别是对排名边界附近的工具。
- 发现得分差异主要源于微小的运行时波动,例如软超时与硬超时之间的变化,或在临界案例中出现的内存溢出与超时结果的差异。
实验结果
研究问题
- RQ1能否使用官方资料和基础设施成功复现 SV-COMP 2023 的代表性子集?
- RQ2重新执行结果中出现的轻微得分波动在多大程度上影响了 SV-COMP 2023 的整体工具排名?
- RQ3观察到的得分差异是否可归因于运行时波动或系统级不稳定性,特别是对临界基准测试实例而言?
- RQ4复现大规模工具竞赛面临哪些实际挑战,未来如何缓解这些问题?
- RQ5对子集进行抽样检查是否足以建立对大规模实验结果(如 SV-COMP)可复现性的信心?
主要发现
- 作者成功使用赛事官方脚本、工具和基础设施复现了 SV-COMP 2023 的代表性子集,证实了在相同条件下实现可复现性的可行性。
- 观察到轻微的得分波动——例如,UAutomizer 在 ConcurrencySafety 中的得分从 2725 上升至 2733,UTaipan 从 2607 上升至 2613——这是由于在临界案例中运行时波动所致。
- 尽管得分有微小变化,但所有测试类别的整体工具排名保持不变,包括获得金牌的 Deagle(4754 分)。
- 在 Termination 类别中发现差异:在重新执行中,VeriFuzz 未报告任何 '正确错误' 结果,表明脚本或执行流程可能存在潜在问题,但原因仍在调查中。
- 对于 Symbiotic 和 Deagle,原始运行与重新执行的得分完全一致,表明这些工具具有高度可复现性。
- 所有工具在运行时间和资源使用方面均观察到微小差异,但这些差异未影响最终的正确性或排名结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。