[論文レビュー] The impact of using biased performance metrics on software defect prediction research
本研究は、ソフトウェア欠陥予測研究におけるバイアスのあるF1スコアの使用がもたらす影響を、12,471組の比較を含む38件の主要研究を通じて、バイアスのないマシューフェアコefficient(MCC)と比較することで調査している。F1からMCCに切り替えた際、結果の方向が変化する割合が21.95%にのぼり、メトリクスのバイアスによって誤った結論に至る重大なリスクが浮き彫りになった。
Context: Software engineering researchers have undertaken many experiments investigating the potential of software defect prediction algorithms. Unfortunately, some widely used performance metrics are known to be problematic, most notably F1, but nevertheless F1 is widely used. Objective: To investigate the potential impact of using F1 on the validity of this large body of research. Method: We undertook a systematic review to locate relevant experiments and then extract all pairwise comparisons of defect prediction performance using F1 and the un-biased Matthews correlation coefficient (MCC). Results: We found a total of 38 primary studies. These contain 12,471 pairs of results. Of these, 21.95% changed direction when the MCC metric is used instead of the biased F1 metric. Unfortunately, we also found evidence suggesting that F1 remains widely used in software defect prediction research. Conclusions: We reiterate the concerns of statisticians that the F1 is a problematic metric outside of an information retrieval context, since we are concerned about both classes (defect-prone and not defect-prone units). This inappropriate usage has led to a substantial number (more than one fifth) of erroneous (in terms of direction) results. Therefore we urge researchers to (i) use an unbiased metric and (ii) publish detailed results including confusion matrices such that alternative analyses become possible.
研究の動機と目的
- バイアスのあるF1スコアの使用が、ソフトウェア欠陥予測研究の妥当性に与える影響を評価すること。
- F1が既知の統計的限界を有するにもかかわらず、欠陥予測研究でどれほど頻繁に使用されているかを特定すること。
- 特にデータクラスの不均衡が顕著な状況下で、F1がどれほど誤解を招きやすいかを特定すること。
- 大規模な実証的研究の集積において、F1の結果とバイアスのないマシューフェアコefficient(MCC)の結果を比較すること。
- 今後の研究において、非バイアスメトリクスの採用と混同行列の透明な報告を提唱すること。
提案手法
- F1スコアとMCCスコアの両方を報告しているソフトウェア欠陥予測実験に関する主要研究を特定するための体系的レビューを実施した。
- F1とMCCの両方を報告している38件の主要研究から、12,471組のモデル性能比較を抽出した。
- F1からMCCに切り替えた際、比較の方向性(例:モデルAがモデルBより優れている)が変化するかどうかを評価するためのメタアナリシスを実施した。
- 理論的および実証的分析を通じて、混同行列の順列を用いて、クラスの不均衡がF1のバイアスを悪化させる役割を分析した。
- 情報検索の文脈を超えた二値分類におけるF1の限界を、統計学および機械学習の文献を用いて批判的に検討した。
- 再現可能性およびさらなる分析を可能にするために、原始データおよび分析コードをZenodo(DOI: 10.5281/zenodo.4899090)で公開した。
実験結果
リサーチクエスチョン
- RQ1F1とMCCの選択が、ソフトウェア欠陥予測研究における性能比較の方向性にどれほど頻繁に逆転をもたらすか?
- RQ2F1が既知の統計的問題を有するにもかかわらず、最近のソフトウェア欠陥予測研究でどれほど広く使用されているか?
- RQ3特にクラスの不均衡が顕著な状況下で、F1が最も誤解を招きやすい条件は何か?
- RQ4F1に基づく研究の結論が、メトリクスのバイアスのため、どれほど誤りである可能性があるか?
- RQ5MCCへの置き換えと完全な混同行列の公開によって、研究の透明性と妥当性はどの程度向上できるか?
主な発見
- 分析された12,471組の比較のうち、F1からMCCに切り替えた際、21.95%が比較の方向性を変更した。これは、メトリクスのバイアスによって誤った結論に至る重大なリスクを示している。
- F1はソフトウェア欠陥予測研究で広く使用されており、2015年から2020年の間の研究の3分の1以上が、既知の統計的欠陥にもかかわらず、依然としてF1に依存している。
- F1スコアは特に不均衡なデータセットにおいて深刻な問題を引き起こす。これは、全体のバランスを損なう代わりに、高精度または高再現率のモデルを系統的に優遇する傾向があるためである。
- マシューフェアコefficient(MCC)は、ソフトウェア欠陥予測における二値分類タスクにおいて、F1よりもより強固で非バイアスな代替手段である。
- 本研究は、F1がクラス分布への感受性と偽陽性・偽陰性の非対称的処理に起因して、研究者が最適でないモデルを選択する誤解を招く可能性があることを示している。
- 研究者は、完全な混同行列の公開によって、代替メトリクスの分析が可能になり、欠陥予測研究の再現性と妥当性が向上することを証明している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。