Skip to main content
QUICK REVIEW

[论文解读] Evaluating software defect prediction performance: an updated benchmarking study

Libo Li, Stefan Lessmann|arXiv (Cornell University)|Jan 7, 2019
Software Engineering Research被引用 4
一句话总结

本文通過提出一個更新的基準測試框架,重新審視軟件缺陷預測問題,該框架整合了改進的評估指標、測試程序(頻頻主義與貝葉斯方法)以及多樣化的數據集與模型。研究發現,預測準確率通常較高,但極其敏感於評估方法,分類器性能在不同項目中差異顯著,強調了需要多維度評估以減少偏差。

ABSTRACT

Accurately predicting faulty software units helps practitioners target faulty units and prioritize their efforts to maintain software quality. Prior studies use machine-learning models to detect faulty software code. We revisit past studies and point out potential improvements. Our new study proposes a revised benchmarking configuration. The configuration considers many new dimensions, such as class distribution sampling, evaluation metrics, and testing procedures. The new study also includes new datasets and models. Our findings suggest that predictive accuracy is generally good. However, predictive power is heavily influenced by the evaluation metrics and testing procedure (frequentist or Bayesian approach). The classifier results depend on the software project. While it is difficult to choose the best classifier, researchers should consider different dimensions to overcome potential bias.

研究动机与目标

  • 為解決以往軟件缺陷預測研究中的局限性,識別評估實踐中的方法論缺陷。
  • 提出一個修正的基準測試配置,整合類別分佈抽樣、多樣化評估指標以及穩健的測試程序(頻頻主義與貝葉斯方法)。
  • 評估現代機器學習模型在新增數據集上的表現,以確保基準測試的時效性與可靠性。
  • 通過強調在不同軟件項目與配置下的多維度評估,減少模型選擇中的偏差。
  • 為研究人員提供一個標準化、全面的框架,以實現缺陷預測模型的公平且可重現的評估。

提出的方法

  • 本研究引入了一個修正的基準測試配置,包含系統性的類別分佈抽樣,以反映現實世界中不平衡的數據。
  • 採用多種評估指標(如 AUC、F1 分數和 G-mean)來評估模型表現,超越僅依賴準確率。
  • 作者應用頻頻主義與貝葉斯測試程序,評估模型比較的統計顯著性與穩健性。
  • 整合來自公共倉庫的新數據集,以確保基準測試的相關性與多樣性。
  • 在相同標準化配置下評估多種機器學習模型,以確保公平比較。
  • 該框架強調可重現性,詳細記錄所有超參數、數據劃分與評估協議。

实验结果

研究问题

  • RQ1不同評估指標如何影響缺陷預測模型的感知性能?
  • RQ2使用頻頻主義與貝葉斯測試程序對模型比較結果有何影響?
  • RQ3在相同基準測試配置下,模型性能如何在不同軟件項目中變化?
  • RQ4類別分佈抽樣策略在多大程度上影響模型的可靠性與泛化能力?
  • RQ5哪種評估指標與測試程序的組合能提供最穩健且無偏差的缺陷預測模型評估?

主要发现

  • 軟件缺陷預測中的預測準確率通常較高,但表現顯著依賴於評估指標的選擇。
  • 貝葉斯測試程序在小樣本情境下揭示了比頻頻主義方法更細微的模型性能差異。
  • 分類器性能極其依賴於項目,難以在所有情境下識別出單一「最佳」模型。
  • 使用平衡評估指標(如 G-mean 和 F1 分數)提供的資訊比僅依賴準確率更可靠,特別是在不平衡數據集中。
  • 基準測試框架表明,方法論選擇(特別是在評估與測試方面)可能在模型評估中引入顯著偏差。
  • 本研究確認,沒有任何一個模型在所有項目與評估標準下持續優於其他模型,強調了上下文感知模型選擇的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。