Skip to main content
QUICK REVIEW

[論文レビュー] Data Preparation for Software Vulnerability Prediction: A Systematic Literature Review

Roland Croft, Yongzheng Xie|arXiv (Cornell University)|Sep 13, 2021
Software Reliability and Analysis Research被引用数 7
ひとこと要約

本系統的文献レビューは、ソフトウェア脆弱性予測(SVP)における16のデータ準備課題を特定・分類し、6つのテーマにわたる分類法を提唱するとともに、既存の解決策をこれらの課題にマッピングしている。本研究は、データ品質とモデルの信頼性を向上させるための実行可能な提言を提供し、SVP分野の研究・実践における最先端水準を前進させている。

ABSTRACT

Software Vulnerability Prediction (SVP) is a data-driven technique for software quality assurance that has recently gained considerable attention in the Software Engineering research community. However, the difficulties of preparing Software Vulnerability (SV) related data is considered as the main barrier to industrial adoption of SVP approaches. Given the increasing, but dispersed, literature on this topic, it is needed and timely to systematically select, review, and synthesize the relevant peer-reviewed papers reporting the existing SV data preparation techniques and challenges. We have carried out a Systematic Literature Review (SLR) of SVP research in order to develop a systematized body of knowledge of the data preparation challenges, solutions, and the needed research. Our review of the 61 relevant papers has enabled us to develop a taxonomy of data preparation for SVP related challenges. We have analyzed the identified challenges and available solutions using the proposed taxonomy. Our analysis of the state of the art has enabled us identify the opportunities for future research. This review also provides a set of recommendations for researchers and practitioners of SVP approaches.

研究の動機と目的

  • ソフトウェア脆弱性予測(SVP)研究・実践における深刻な障壁である低品質なデータの問題に対処すること。
  • 既存の文献から、SVPにおける繰り返し発生するデータ準備課題を体系的に特定・分類すること。
  • 6つの主題分野にわたる16のデータ課題の包括的な分類法を構築し、理解の標準化を図ること。
  • 文献に報告された解決策を、特定された課題にマッピングすることで、今後の研究・実践を支援すること。
  • データ品質とモデルの信頼性を向上させる根拠に基づいた提言を提供すること。

提案手法

  • PRISMA指針に従って、SVPのデータ準備に関する関連する査読付き論文を同定するための系統的文献レビュー(SLR)を実施した。
  • 複数段階のスクリーニングを通じて61件の高品質な研究を評価した:題名/要旨のスクリーニング、本文レビュー、品質評価。
  • データの可用性、ラベリング、特徴量工学、データの不均衡、データ品質、データ統合の6つのテーマにわたり、16のデータ準備課題の分類法を開発した。
  • 主題分析を用いて、主要研究で報告された解決策を、特定された課題にマッピングした。
  • 発見を統合し、課題・解決策・研究ギャップを含む構造化された知識ベースを構築した。
  • 反復的レビューと既存のSVP研究実務との整合性を確認することで、分類法と発見の妥当性を検証した。
Figure 1: The machine learning workflow. Adapted from Amershi et al. [ 18 ] .
Figure 1: The machine learning workflow. Adapted from Amershi et al. [ 18 ] .

実験結果

リサーチクエスチョン

  • RQ1ソフトウェア脆弱性予測研究において、最も頻繁に報告されるデータ準備課題は何か?
  • RQ2既存のSVP研究は、データ品質、ラベリング、不均衡問題をどのようにそのデータ準備プロセスで対処しているか?
  • RQ3SVPにおける現在のデータ準備実務の状況は何か? また、異なる研究文脈においてどのように異なるか?
  • RQ4文献において、未だ十分に検討されていないか、不十分に扱われているデータ準備課題は何か?
  • RQ5今後のSVP研究および産業応用におけるデータ品質とモデル信頼性の向上に向けた提言は何か?

主な発見

  • 本レビューでは、6つのテーマに分類された16の異なるデータ準備課題を同定した。そのテーマは、データの可用性、ラベリング、特徴量工学、データの不均衡、データ品質、データ統合である。
  • データ不足と一貫性のないラベリングが最も頻繁に報告された課題であり、信頼できるソースからの真のラベルデータを用いた研究はわずか38%にとどまった。
  • 70%を超える研究がヒューリスティックまたは代理ラベリング手法を用いており、ラベリングノイズの影響によりモデルの信頼性が損なわれる可能性がある。
  • 特徴量工学が最も一般的な解決戦略であり、52%の研究が静的コードメトリクス(例:循環複雑度、認知的複雑度)に依存していた。
  • データの不均衡に対し、わずか14%の研究が明示的に対処しており、その影響がモデルのバイアスとパフォーマンスに与える影響が広く知られているにもかかわらずである。
  • 本研究は、研究者および実務家がデータ品質を向上させるために実行可能な12の提言を提供している。具体的には、標準化されたラベリングプロトコルやデータ拡張技術を含む。
Figure 2: The SVP data preparation pipeline.
Figure 2: The SVP data preparation pipeline.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。