Skip to main content
QUICK REVIEW

[論文レビュー] Explainable Software Defect Prediction: Are We There Yet?

Jiho Shin, Reem Aleithan|arXiv (Cornell University)|Nov 21, 2021
Software Engineering Research参考文献 56被引用数 8
ひとこと要約

本研究は、さまざまなデータサンプリング、機械学習分類器、予測シナリオにおいて、モデルに依存しない解釈手法(LIMEとBreakDown)の信頼性および安定性を調査する。結果として、設定間で一貫性のない解釈が得られ、根本的要因を反映していないことが判明し、以前の有効性に関する主張にもかかわらず、実用的有用性に疑問が呈される。

ABSTRACT

Explaining the prediction results of software defect prediction models is a challenging while practical task, which can provide useful information for developers to understand and fix the predicted bugs. To address this issue, recently, Jiarpakdee et al. proposed to use {two state-of-the-art} model-agnostic techniques (i.e., LIME and BreakDown) to explain the prediction results of bug prediction models. Their experiments show these tools can generate promising results and the generated explanations can assist developers understand the prediction results. However, the fact that LIME and BreakDown were only examined on a single software defect prediction model setting calls into question about their consistency and reliability across software defect prediction models with various settings. In this paper, we set out to investigate the consistency and reliability of model-agnostic technique based explanation generation approaches (i.e., LIME and BreakDown) on software defect prediction models with different settings , e.g., different data sampling techniques, different machine learning classifiers, and different prediction scenarios. Specifically, we use both LIME and BreakDown to generate explanations for the same instance under software defect prediction models with different settings and then check the consistency of the generated explanations for the instance. We reused the same defect data from Jiarpakdee et al. in our experiments. The results show that both LIME and BreakDown generate inconsistent explanations under different software defect prediction settings for the same test instances, which makes them unreliable for explanation generation. Overall, with this study, we call for more research in explainable software defect prediction towards achieving consistent and reliable explanation generation.

研究の動機と目的

  • 多様なモデリング設定下における、モデルに依存しない解釈手法(LIMEおよびBreakDown)の信頼性および安定性を評価すること。
  • 異なるデータサンプリング手法、分類器、予測シナリオを用いて欠附予測モデルを構築した場合、解釈が一貫しているかどうかを調査すること。
  • 生成された解釈が、表面的または誤った特徴量の寄与ではなく、実際の欠附の根本的要因を反映しているかどうかを評価すること。
  • 以前の主張であるLIMEおよびBreakDownが開発者にとって実行可能で信頼できる解釈を提供するとの主張の実用的妥当性に疑問を呈すること。
  • 解釈手法のより厳密な評価および、解釈可能なソフトウェア欠附予測のためのより信頼性の高い手法の開発を促すこと。

提案手法

  • Jiarpakdeeら[1]が使用した同じ欠附データセットを再利用し、9つの大規模なオープンソースJavaプロジェクトから得られた32バージョンのファイルレベル欠附データを含む。
  • 同じテストインスタンスに対して、異なる設定を持つ複数の欠附予測モデルを用いて、LIMEおよびBreakDownを適用し、インスタンスレベルの解釈を生成した。
  • 3つの主要な設定を体系的に変化させた:データサンプリング手法(5通り)、機械学習分類器(6モデル)、予測シナリオ(クロスバージョンおよびクロスプロジェクト)。
  • 同じインスタンスに対して異なるモデル設定における特徴量の重要度順位を比較することで、解釈の一貫性を測定した。
  • 一部のインスタンスについて手動分析を実施し、生成された解釈が実際の欠附の根本的要因と一致しているかどうかを評価した。
  • 定量的一致性チェックと定性的な手動検査の両方を用いて、解釈の信頼性および有用性を評価した。

実験結果

リサーチクエスチョン

  • RQ1欠附予測モデルを異なるデータサンプリング手法で構築した場合、LIMEおよびBreakDownが生成する解釈はどの程度一貫しているか?
  • RQ2欠附予測モデルで使用される異なる機械学習分類器の間で、解釈はどの程度安定しているか?
  • RQ3欠附予測における異なる予測シナリオ(例:クロスバージョン対クロスプロジェクト)において、解釈の出力はどのように変化するか?
  • RQ4手動検査によって特定された実際の欠附の根本的要因をどの程度反映しているか、生成された解釈はどの程度の程度で反映しているか?
  • RQ5LIMEやBreakDownのようなモデルに依存しない解釈手法は、ソフトウェア欠附予測における実用的使用に耐えるほど信頼性があり安定していると言えるか?

主な発見

  • LIMEおよびBreakDownは、異なる欠附予測設定(異なるデータサンプリング手法、分類器、予測シナリオを含む)において、顕著に一貫性のない解釈を生成する。
  • 特徴量の重要度順位の不一致は、解釈の信頼性を損なうものであり、実際の意思決定支援には不適切である。
  • 手動分析の結果、生成された解釈のいずれのものも、予測された欠附の真の根本的要因を正確に反映していないことが確認された。
  • 本研究は、以前の主張(LIMEおよびBreakDownは実行可能で洞察に満ちた解釈を提供する)を覆し、解釈がしばしば関係のないまたは誤った特徴量を強調することが多いことが判明した。
  • 研究結果から、モデルに依存しない解釈手法は、実世界のソフトウェア欠附予測システムにおける使用には信頼性も安定性もないと示唆される。
  • 結果として、既存のモデルに依存しないアプローチの再評価が求められ、ソフトウェア工学分野におけるより強固で信頼できる解釈手法の開発の必要性が強調される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。