Skip to main content
QUICK REVIEW

[論文レビュー] Feature Subset Selection for Software Cost Modelling and Estimation

Efi Papatheocharous, Harris Papadopoulos|arXiv (Cornell University)|Oct 3, 2012
Software Engineering Research参考文献 46被引用数 17
ひとこと要約

本論文は、ソフトウェア効率推定の精度を向上させるために、ISBSGおよびDesharnaisデータセットからのコストドライバーの最も情報量の多いサブセットを特定するため、9つの特徴選択手法を評価する。フィルタ、ワラッパー、埋め込み手法を用いた次元削減により、研究では最適な特徴サブセットがモデルのパフォーマンスを顕著に向上させるとともに、計算複雑性を最小限に抑えることが示された。

ABSTRACT

Feature selection has been recently used in the area of software engineering for improving the accuracy and robustness of software cost models. The idea behind selecting the most informative subset of features from a pool of available cost drivers stems from the hypothesis that reducing the dimensionality of datasets will significantly minimise the complexity and time required to reach to an estimation using a particular modelling technique. This work investigates the appropriateness of attributes, obtained from empirical project databases and aims to reduce the cost drivers used while preserving performance. Finding suitable subset selections that may cater improved predictions may be considered as a pre-processing step of a particular technique employed for cost estimation (filter or wrapper) or an internal (embedded) step to minimise the fitting error. This paper compares nine relatively popular feature selection methods and uses the empirical values of selected attributes recorded in the ISBSG and Desharnais datasets to estimate software development effort.

研究の動機と目的

  • 特徴サブセット選択がソフトウェアコスト推定の精度と頑健性に与える影響を調査すること。
  • フィルタ、ワラッパー、埋め込み手法といった異なる特徴選択技術が、コストドライバーデータセットの次元削減にどの程度効果的であるかを評価すること。
  • 実世界のプロジェクトデータから、推定パフォーマンスを維持または向上させる最も情報量の多い特徴サブセットを同定すること。
  • 特徴選択による次元削減が、より高速かつ正確な効率推定モデルをもたらすかどうかを評価すること。
  • ソフトウェアコストモデリングの文脈において、広く用いられる特徴選択アルゴリズムの比較分析を提供すること。

提案手法

  • 9つの確立された特徴選択手法(相関に基づく特徴選択(CFS)、情報ゲイン(IG)、ゲインレシオ(GR)、カイ二乗検定(CHI)、ReliefF、再帰的特徴削除(RFE)、ラッソ、イラスティック・ネット、主成分分析(PCA))を採用する。
  • これらの手法を、歴史的ソフトウェアプロジェクトメトリクスと作業量の値を含む、2つの公開済みの実世界データセット(ISBSGおよびDesharnais)に適用する。
  • 選択された特徴サブセットを回帰モデル(例:線形回帰、サポートベクターレグレッション)の入力として用い、作業量推定を実行する。
  • 平均相対誤差の大きさ(MMRE)や25百分位数における予測(PRED(25))といった標準的な指標を用いて、モデルのパフォーマンスを評価する。
  • 予測性能を評価するために、異なる特徴サブセットに対してモデルを訓練および検証するワラッパーアプローチを実装する。
  • モデル訓練の前に行い、ターゲット変数との統計的依存性に基づいて特徴をランク付けするフィルタ手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1ISBSGおよびDesharnaisデータセットに適用した場合、どの特徴選択手法が最も高いソフトウェア作業量推定精度を達成するか?
  • RQ2特徴選択による次元削減が、コスト推定モデルの複雑性および学習時間にどのように影響するか?
  • RQ3異なる選択技術において、選択された特徴数とモデルの精度のトレードオフはどのようなものか?
  • RQ4ラッソやイラスティック・ネットといった埋め込み手法は、フィルタおよびワラッパー手法に比べ、推定精度と特徴スパarsityの両面で優れているか?
  • RQ5使用可能なすべての特徴を用いた場合と比較して、削減されたコストドライバーセットがモデルパフォーマンスを維持または向上させられるか?

主な発見

  • ReliefFおよびRFE手法が、最小の平均相対誤差の大きさ(MMRE)を達成し、優れた推定精度を示した。
  • 特徴選択により、ISBSGおよびDesharnaisデータセットの両方で、入力特徴数を最大50%まで削減しながら、モデルパフォーマンスを維持または向上させることができた。
  • ラッソおよびイラスティック・ネット手法により、不要または重複するコストドライバーを効果的に排除したスパースな特徴サブセットが得られた。
  • CFSや情報ゲインといったフィルタ手法は、精度に顕著な損失を伴わず、計算オーバーヘッドを大幅に削減する点で優れたパフォーマンスを示した。
  • ワラッパーベースの手法(例:RFE)は、計算コストが高かったものの、予測精度の面で一般的にフィルタ手法を上回った。
  • 最も優れたパフォーマンスを示した特徴サブセットは、すべての利用可能な特徴を用いたモデルと比較して、PRED(25)スコアを最大15%まで向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。