Skip to main content
QUICK REVIEW

[論文レビュー] Why Software Effort Estimation Needs SBSE

Tianpei Xia, Jianfeng Chen|arXiv (Cornell University)|Apr 2, 2018
Software Engineering Research参考文献 48被引用数 3
ひとこと要約

本稿では、差分進化を用いてソフトウェアプロジェクトの作業量推定モデルを自動構成する、CPU負荷が軽いSBSEフレームワークOILを提案する。945のプロジェクトで評価した結果、ABE0 や ATLM といった広く使われている手法を上回り、40~160回の評価で、標準ラップトップで中央値6分未塔の実行時間で顕著に低い推定誤差を達成した。

ABSTRACT

Industrial practitioners now face a bewildering array of possible configurations for effort estimation. How to select the best one for a particular dataset? This paper introduces OIL (short for optimized learning), a novel configuration tool for effort estimation based on differential evolution. When tested on 945 software projects, OIL significantly improved effort estimations, after exploring just a few configurations (just a few dozen). Further OIL's results are far better than two methods in widespread use: estimation-via-analogy and a recent state-of-the-art baseline published at TOSEM'15 by Whigham et al. Given that the computational cost of this approach is so low, and the observed improvements are so large, we conclude that SBSE should be a standard component of software effort estimation.

研究の動機と目的

  • 数千もの可能な構成がある中で、与えられたデータセットに対して最適な作業量推定手法を選択する課題に対処すること。
  • 従来の進化的アルゴリズムに比べて高い評価コストを要するが、CPU負荷が軽いアプローチを採用することで、作業量推定におけるSBSEの計算負担を軽減すること。
  • SBSEによる自動構成が、ATLM や ABE0 といった広く使われているベースライン手法と比較して、顕著に高い推定精度を達成できることを示すこと。
  • 限られた計算リソースや小さなデータセットでも、SBSEが実用的かつ必須であることを示すこと。
  • 床効果(floor effects)や固有のデータ制限が、作業量推定モデルの性能を制限するかどうかを調査し、このような条件下でもSBSEが著しい改善をもたらすかどうかを検証すること。

提案手法

  • OILは、類似性ベースの作業量推定(ABE)手法の構成空間を探索するため、差分進化(DE)を探索アルゴリズムとして採用する。
  • 候補となる構成の評価には、未知のデータに対するモデル性能を推定するために10-fold交差検証を用いる。
  • OILは、類似性尺度、正規化手法、外れ値処理法などのABEパラメータの数千もの組み合わせを体系的に探索し、最適な構成を同定する。
  • 探索は、DEの変異、交叉、選択メカニズムに従い、Stornらの提案するデフォルトパラメータ設定を採用することで、安定性と効率性を確保する。
  • フレームワークは低コスト設計となっており、945のプロジェクト全体で中央値6分の実行時間(標準の8GB、3GHzデスクトップ)を記録した。
  • OILは再利用可能で拡張性のあるPython pipパッケージとして実装されており、研究者および実務家コミュニティにおける採用を促進する。

実験結果

リサーチクエスチョン

  • RQ1RQ1: 作業量推定はSBSEを無視できるか?複数のデータセットで一貫して優れた性能を示す少数の手法があれば、チューニングは回避可能だろうか?
  • RQ2RQ2: SBSEは実用上、特に開発者やビジネスユーザーにとって計算コストが高すぎるのだろうか?
  • RQ3RQ3: SBSEは、ABE0 や ATLM といった広く使われている手法よりも優れた作業量推定を生み出せるだろうか?
  • RQ4RQ4: 作業量推定には床効果(floor effects)が存在し、手法の複雑さに関係なく性能向上が制限されるのだろうか?
  • RQ5RQ5: 評価回数(例:40回から160回)を増やすことで、より良い推定性能が得られるだろうか?

主な発見

  • OILは945のソフトウェアプロジェクト全体で、ABE0 や ATLM を顕著かつ統計的にも優れた推定誤差で上回った。
  • OILの10-fold交差検証の中央値実行時間は、標準の8GB、3GHzデスクトップマシンでわずか6分であった。
  • 候補構成の評価を40回にとどめても、最適またはほぼ最適な性能が達成可能であり、低スペックハードウェアでもSBSEが計算的に実行可能であることが示された。
  • 評価回数を40回から160回に増やしても、さらなる改善が得られなかったため、探索空間が最小限の努力で効率的に探索可能であることが示された。
  • 最も優れた推定手法はデータセットごとに顕著に異なっており、一貫して最適な手法が存在しないことが明らかになった。したがって、SBSEによる自動構成の必要性が裏付けられた。
  • 床効果の兆候が観察された:一部のデータセットでは信号が限定的であり、ランダムサーチャーでさえDEと同程度の性能を示す場合があり、特定のデータ分布には固有の性能上限が存在することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。