[論文レビュー] A Comparative Study of Different Source Code Metrics and Machine Learning Algorithms for Predicting Change Proneness of Object Oriented Systems
本研究では、18種類の分類器と3種類のアンサンブル手法を用いて、オブジェクト指向システムにおける変更感受性を予測するために、21のソースコードメトリクスと11の特徴選択手法を評価した。提案された特徴選択フレームワーク(PFST)を用いて選択されたメトリクスと組み合わせたLSSVM-RBFモデルが、他の分類器や特徴選択アプローチを上回る最高の正確性を達成した。
Change-prone classes or modules are defined as software components in the source code which are likely to change in the future. Change-proneness prediction is useful to the maintenance team as they can optimize and focus their testing resources on the modules which have a higher likelihood of change. Change-proneness prediction model can be built by using source code metrics as predictors or features within a machine learning classification framework. In this paper, twenty one source code metrics are computed to develop a statistical model for predicting change-proneness modules. Since the performance of the change-proneness model depends on the source code metrics, they are used as independent variables or predictors for the change-proneness model. Eleven different feature selection techniques (including the usage of all the $21$ proposed source code metrics described in the paper) are used to remove irrelevant features and select the best set of features. The effectiveness of the set of source code metrics are evaluated using eighteen different classiffication techniques and three ensemble techniques. Experimental results demonstrate that the model based on selected set of source code metrics after applying feature selection techniques achieves better results as compared to the model using all source code metrics as predictors. Our experimental results reveal that the predictive model developed using LSSVM-RBF yields better result as compared to other classification techniques
研究の動機と目的
- オブジェクト指向ソフトウェアにおける21のソースコードメトリクスの変更感受性予測への有効性を調査すること。
- 11の特徴選択手法が予測モデルのパフォーマンス向上に与える影響を評価すること。
- 18種類の機械学習分類器と3種類のアンサンブル手法が、変更感受性のあるクラスを予測する際のパフォーマンスを比較すること。
- 正確な変更感受性予測のための最適なメトリクス、特徴選択、分類手法の組み合わせを特定すること。
- オープンソースデータセットと標準化されたツールを用いた再現可能な変更感受性予測フレームワークを提供すること。
提案手法
- Eclipse 2.0および2.1プラグインに対して、Understandツールを用いて21のオブジェクト指向ソフトウェアメトリクス(例:循環的複雑度、結合度、継承の深さ)を計算した。
- Jar Compareツールを用いてバージョン間の変更されたクラスを特定し、訓練データを変更感受性あり/なしにラベル付けした。
- フィルタ法、ワラッパー法、埋め込み法を含む11の特徴選択手法を適用し、不適切なメトリクスを低減し、最適なサブセットを選択した。
- 選択されたメトリクスサブセット上で18の個々の分類器(例:SVM、ランダムフォレスト、RBFN)と3つのアンサンブル手法(例:NDTF、バギング、ブースティング)を訓練した。
- モデルのパフォーマンスを統計的に比較するために、ウィルコクソン符号順位検定と平均差分析を用いた。
- 正確性、F1スコア、誤分類誤差などの標準的な分類指標を用いてモデルを評価した。
実験結果
リサーチクエスチョン
- RQ1異なるEclipseプラグインにおいて、どのソースコードメトリクスがクラスの変更感受性と顕著に相関しているか?
- RQ2特徴選択を用いてメトリクスのサブセットを選択することで、全21メトリクスを使用する場合と比較して、変更感受性予測の正確性が向上するか?
- RQ3特徴選択後の機械学習分類器の中で、どの分類器が最も高いパフォーマンスを示すか?
- RQ4異なる特徴選択手法は、モデルパフォーマンスの向上能力においてどのように比較されるか?
- RQ5アンサンブル手法は、個々の分類器と比較して、変更感受性予測においてどのように性能を発揮するか?
主な発見
- LSSVM-RBF分類器は、テストされた18の個々の分類器の中で最も高い正確性と最小の誤分類誤差を達成した。
- 提案された特徴選択フレームワーク(PFST)は、性能指標の平均差の観点から、他の特徴選択手法を一貫して上回った。
- 非線形アンサンブル意思決定木フォレスト(NDTF)アンサンブル手法は、他のすべてのアンサンブル手法を上回り、全体的なパフォーマンスではLSSVM-RBFに次いで2番目に優れていた。
- PFSTによって選択された小さなソースコードメトリクスサブセットが、全21メトリクスを使用するモデルよりも高い予測正確性を達成した。
- 特徴選択手法のパフォーマンスは、分類器の選択に大きく依存しており、特徴選択と学習アルゴリズムの間には強い相互作用効果が存在することが示された。
- 統計的分析により、モデルパフォーマンスの差が有意であることが確認され、LSSVM-RBFおよびPFSTベースのモデルが、すべてのデータセットで最も安定した結果を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。