[論文レビュー] A Survey on the Evaluation of Clone Detection Performance and Benchmarking
本論文は、ソフトウェア工学分野におけるクローン検出ツールの評価、ベンチマーク手法、および実証的検証手法について包括的なサーベイを提示する。184のクローン検出ツールを分析し、再現率、適合率、実行時間、スケーラビリティの4つの指標に基づいてその性能を評価した。現在の評価手法における主な欠陥を特定し、研究の質と再現可能性を向上させるために、標準化されたベンチマークときめ細やかな実証的検証の導入を提唱する。
There are a great many clone detection tools proposed in the literature. In this paper, we investigate the state of clone detection tool evaluation. We begin by surveying the clone detection benchmarks, and performing a multi-faceted evaluation and comparison of their features and capabilities. We then survey the existing clone detection tool and technique publications, and evaluate how the authors of these works evaluate their own tools/techniques. We rank the individual works by how well they measure recall, precision, execution time and scalability. We select the works the best evaluate all four metrics as exemplars that should be considered by future researchers publishing clone detection tools/techniques when designing the empirical evaluation of their tool/technique. We measure statistics on tool evaluation by the authors, and find that evaluation is poor amongst the authors. We finish our investigation into clone detection evaluation by surveying the existing tool comparison studies, including both the qualitative and quantitative studies.
研究の動機と目的
- クローン検出ツールの評価およびベンチマーク手法がソフトウェア工学研究でどのように行われているかを調査すること。
- 特に再現率、適合率、実行時間、スケーラビリティの測定に関して、クローン検出ツールの評価方法に見られる欠陥を特定すること。
- 既存のクローン検出ベンチマークの質、包括性、および標準化されたツール比較に適した適合性を評価すること。
- ツール比較研究を分析し、今後の研究の模範となる高品質できめ細やかな評価を特定すること。
- ベストプラクティスを特定し、クローン検出研究における一貫性があり包括的な実証的検証の推進を通じて、評価基準の改善を促すこと。
提案手法
- 2017年までに文献に発表された184のクローン検出ツールおよび技術を体系的にサーベイした。
- 再現率、適合率、実行時間、スケーラビリティの4つの主要な性能指標に基づき、各ツールを評価した。
- ベンチマークで使用される参照コーパスおよびオラクルメカニズムを分析し、評価結果の妥当性と信頼性を評価した。
- 設計、範囲、評価基準の観点から10の主要なクローン検出ベンチマーク(例:Bellonのもの、BigCloneBench、ForkSim)を分類・比較した。
- ツールの著者たちの評価実態を調査し、指標の使用頻度、評価範囲、指標間の相関関係を分析した。
- 今後の研究や査読のモデルとして機能する、包括的かつ多指標評価を実施した模範的な研究を特定した。
実験結果
リサーチクエスチョン
- RQ1現在使用されているクローン検出のベンチマークは何か? また、設計、カバレッジ、品質の観点からそれらをどのように比較できるか?
- RQ2クローン検出ツールの著者は、再現率、適合率、実行時間、スケーラビリティの観点から、現在どのようにそのツールを評価しているか?
- RQ3クローン検出研究の出版物において、評価手法がどの程度標準化されたり、きめ細やかになったりしているか?
- RQ4クローン検出の評価およびツール比較研究における妥当性の主な脅かは何か?
- RQ5どのような研究が、クローン検出ツールの高品質で包括的な評価の模範として機能するか?
主な発見
- クローン検出ツール論文のわずか10%未満が、再現率、適合率、実行時間、スケーラビリティという4つの主要指標を網羅的に評価している。
- 多くのツールの著者は、形式的または不完全な評価に依存しており、しばしば適合率やスケーラビリティの測定を省略している。これは、性能向上の主張の信頼性を損なう要因となっている。
- 最もきめ細やかな評価は、BigCloneBenchおよびBellonのベンチマークを用いた研究で見られた。これらは、構造化された手動検証済みの参照コーパスを提供している。
- 標準化されたベンチマークの著しい不足が、過去にアルゴリズムの新規性に基づいて新しいツールが受け入れられる傾向にあった原因となっている。
- 高品質なツール比較研究はわずかにしか存在しないが、それらは多指標・再現可能な評価が可能であり、信頼できる研究にとって不可欠であることを示している。
- FalkeらやQuらの研究は、複数の指標と参照コーパスを用いた包括的な評価を実施しており、今後の研究の基準としての役割を果たしている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。