[论文解读] An Empirical Study of Fault Localization Families and Their Combinations
本论文对来自 Defects4J 的 357 个真实世界缺陷中的 11 种故障定位技术(分属七个家族)进行了实证研究。通过使用学习排序方法组合多种技术,所提出的 CombineFL 框架在 top-1 故障定位方面相比最佳独立方法实现了 200% 的性能提升,表明结合多样化信息源可显著增强有效性,同时兼顾执行时间的权衡。
The performance of fault localization techniques is critical to their adoption in practice. This paper reports on an empirical study of a wide range of fault localization techniques on real-world faults. Different from previous studies, this paper (1) considers a wide range of techniques from different families, (2) combines different techniques, and (3) considers the execution time of different techniques. Our results reveal that a combined technique significantly outperforms any individual technique (200% increase in faults localized in Top 1), suggesting that combination may be a desirable way to apply fault localization techniques and that future techniques should also be evaluated in the combined setting. Our implementation is publicly available for evaluating and combining fault localization techniques.
研究动机与目标
- 评估多样化故障定位技术在真实世界软件缺陷上的有效性和效率。
- 研究不同家族故障定位技术之间的相关性,并评估其组合潜力。
- 设计并评估一种可配置、时间感知的组合框架(CombineFL),以平衡性能与执行成本。
- 提供一个开源基础设施(CombineFL-core),用于未来研究中评估和组合故障定位技术。
- 测量并分类不同故障定位家族的执行时间,以指导实际部署策略。
提出的方法
- 本研究评估了来自七个家族的 11 种故障定位技术:基于谱的(SBFL)、基于变异的(MBFL)、动态程序切片、堆栈跟踪分析、谓词切换、基于信息检索的(IR-based)以及基于历史的技術。
- 采用学习排序模型组合来自不同技术的可疑度评分,将每种技术视为黑箱,通过评分的线性组合进行融合。
- 测量每种技术的执行时间,并据此将技术划分为不同成本等级,以支持时间约束下的组合策略。
- 评估基于 Defects4J 数据集,涵盖语句级和方法级两种粒度。
- 引入新指标 $E_{\mathit{inspect}}$,以处理多个故障元素存在时的排名并列问题。
- CombineFL-core 基础设施支持组合的自动化评估,通过标准化的评分和执行时间输入,可轻松集成新技术。
实验结果
研究问题
- RQ1不同家族的独立故障定位技术在真实世界缺陷上的有效性如何?
- RQ2不同家族的故障定位技术之间相关性如何,其组合潜力如何?
- RQ3与独立方法相比,结合来自多样化信息源的技术是否能显著提升故障定位的有效性?
- RQ4故障定位家族之间的执行时间差异如何?时间成本如何用于指导实际的组合策略?
- RQ5在 top-1 故障定位准确率方面,组合技术 CombineFL 是否优于当前最先进方法?
主要发现
- 除 Bugspots 和 BugLocator 外,所有技术在 top-10 中定位的缺陷均超过 6%,其中 SBFL 在 top-10 中达到 44%。
- 大多数技术之间相关性较弱,尤其在不同家族之间,表明其具有较强的互补组合潜力。
- CombineFL 相比最佳独立技术,将 top-1 中定位的缺陷数量提升了 200%,top-3、top-5 和 top-10 的提升率分别为 63%、51% 和 31%。
- 与四种最先进方法——MULTRIC、Savant、FLUCCS 和 TraPT 相比,CombineFL 在 top-1 定位准确率上分别高出 133%、167%、11% 和 18%。
- 执行时间在不同家族间差异显著,可划分为不同成本等级;包含所有低代价技术并未增加运行时间,但提升了有效性。
- 在语句级和方法级两种粒度下,组合技术的优势均成立,证实了该方法的稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。