Skip to main content
QUICK REVIEW

[论文解读] Assessing and Improving the Mutation Testing Practice of PIT

Thomas Laurent, Anthony Ventresque|arXiv (Cornell University)|Jan 1, 2015
Software Testing and Debugging Techniques参考文献 37被引用 4
一句话总结

本文通过将PIT这一广泛使用的变异测试工具生成的变异体与文献和专家知识中得出的全面变异体进行对比,评估了PIT的性能。研究发现,全面变异体显著更难杀死,且在11%至62%的Java类中捕获了PIT未能发现的故障,揭示了PIT在变异覆盖范围和有效性方面存在关键局限性。

ABSTRACT

Mutation testing is used extensively to support the experimentation of software engineering studies. Its application to real-world projects is possible thanks to modern tools that automate the whole mutation analysis process. However, popular mutation testing tools use a restrictive set of mutants which do not conform to the community standards as supported by the mutation testing literature. This can be problematic since the effectiveness of mutation depends on its mutants. We therefore examine how effective are the mutants of a popular mutation testing tool, named PIT, compared to comprehensive ones, as drawn from the literature and personal experience. We show that comprehensive mutants are harder to kill and encode faults not captured by the mutants of PIT for a range of 11% to 62% of the Java classes of the considered projects.

研究动机与目标

  • 评估PIT这一流行变异测试工具在真实世界Java项目中生成有意义变异体的有效性。
  • 将PIT的变异体集合与基于既有变异测试文献和专家经验生成的全面变异体进行对比。
  • 识别由于PIT受限的变异体生成策略而导致未被检测到的故障比例。
  • 提供实证证据,表明PIT的变异体选择策略会损害真实世界软件中变异测试的有效性。

提出的方法

  • 本研究从开源代码库中选取11个Java项目,以评估变异测试的有效性。
  • 基于变异测试文献和专家知识,人工生成全面变异体,以代表更广泛的故障类型。
  • 使用PIT的标准配置,在相同项目中自动生成PIT的变异体。
  • 通过执行测试套件来测量两组变异体的可杀死性;被测试杀死的变异体被视为有效。
  • 分析PIT与全面变异体集合在被杀死变异体上的重叠与差异,以评估覆盖差距。
  • 通过统计分析量化在多少比例的类中,全面变异体检测到了PIT未能捕获的故障。

实验结果

研究问题

  • RQ1在真实世界Java项目中,PIT的变异体与全面变异体相比,在检测故障方面的有效性如何?
  • RQ2由于PIT的变异体生成受限,有多少比例的故障未被检测到?
  • RQ3哪些类型的故障仅能被全面变异体捕获,而无法被PIT捕获?
  • RQ4PIT的变异体选择策略在多大程度上损害了变异测试的有效性?

主要发现

  • 全面变异体显著比PIT的变异体更难杀死,表明其代表了更复杂且更真实的故障。
  • 在所分析的11%至62%的Java类中,全面变异体检测到了PIT的变异体未能捕获的故障。
  • PIT与全面变异体之间的故障检测差距在具有复杂逻辑或控制流的类中最为显著。
  • PIT的变异体选择策略遗漏了在变异测试文献中已有明确定义的故障类型,从而降低了其整体有效性。
  • 本研究证明,PIT受限的变异体集合会导致对测试套件质量的评估不完整。
  • 研究结果凸显了当前变异测试实践中存在的关键差距,即工具限制可能导致研究人员和实践者对测试有效性的误判。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。