Skip to main content
QUICK REVIEW

[논문 리뷰] Data Preparation for Software Vulnerability Prediction: A Systematic Literature Review

Roland Croft, Yongzheng Xie|arXiv (Cornell University)|2021. 09. 13.
Software Reliability and Analysis Research인용 수 7
한 줄 요약

이 체계적 문헌 리뷰는 소프트웨어 취약성 예측(SVP) 분야에서 16개의 데이터 준비 과제를 식별하고 분류하며, 여섯 가지 주제에 걸쳐 분류 체계를 제안하고 기존의 해결책을 이러한 과제들과 연결한다. 본 연구는 데이터 품질 향상과 모델 신뢰성 강화를 위한 실질적인 권고 사항을 제공하여 SVP 연구 및 실무 분야의 기술 수준을 향상시킨다.

ABSTRACT

Software Vulnerability Prediction (SVP) is a data-driven technique for software quality assurance that has recently gained considerable attention in the Software Engineering research community. However, the difficulties of preparing Software Vulnerability (SV) related data is considered as the main barrier to industrial adoption of SVP approaches. Given the increasing, but dispersed, literature on this topic, it is needed and timely to systematically select, review, and synthesize the relevant peer-reviewed papers reporting the existing SV data preparation techniques and challenges. We have carried out a Systematic Literature Review (SLR) of SVP research in order to develop a systematized body of knowledge of the data preparation challenges, solutions, and the needed research. Our review of the 61 relevant papers has enabled us to develop a taxonomy of data preparation for SVP related challenges. We have analyzed the identified challenges and available solutions using the proposed taxonomy. Our analysis of the state of the art has enabled us identify the opportunities for future research. This review also provides a set of recommendations for researchers and practitioners of SVP approaches.

연구 동기 및 목표

  • 소프트웨어 취약성 예측(SVP) 연구 및 실무에서의 심각한 장애 요인인 낮은 데이터 품질 문제를 해결하기 위해.
  • 기존 문헌에서 반복적으로 나타나는 SVP 분야의 데이터 준비 과제를 체계적으로 식별하고 분류하기 위해.
  • 여섯 가지 주제 영역에 걸쳐 16개의 데이터 과제를 포함하는 종합적인 분류 체계를 개발하기 위해.
  • 기존 문헌에서 보고된 해결책을 식별된 과제들과 연결하여 향후 연구 및 실무를 안내하기 위해.
  • SVP에서 데이터 품질 향상과 모델 신뢰성 강화를 위한 근거 기반 권고 사항을 제공하기 위해.

제안 방법

  • SVP 데이터 준비에 관한 관련 학술 논문을 식별하기 위해 PRISMA 지침을 따르는 체계적 문헌 리뷰(SLR)를 수행하였다.
  • 제목/초록 스크리닝, 전문문서 검토, 품질 평가의 다단계 과정을 거쳐 총 61개의 고품질 연구를 선별하였다.
  • 데이터 가용성, 레이블링, 특징 공학, 데이터 불균형, 데이터 품질, 데이터 통합의 여섯 가지 주제에 걸쳐 16개의 데이터 준비 과제 분류 체계를 구축하였다.
  • 주제 분석을 활용하여 주요 연구에서 보고된 해결책을 식별된 과제들과 연결하였다.
  • 발견된 결과를 과제, 해결책, 연구 격차를 포함하는 체계적인 지식 기반으로 통합하였다.
  • 반복적 검토와 기존 SVP 연구 실무와의 일치를 통해 분류 체계 및 결과의 타당성을 검증하였다.
Figure 1: The machine learning workflow. Adapted from Amershi et al. [ 18 ] .
Figure 1: The machine learning workflow. Adapted from Amershi et al. [ 18 ] .

실험 결과

연구 질문

  • RQ1소프트웨어 취약성 예측 연구에서 가장 자주 보고된 데이터 준비 과제는 무엇인가?
  • RQ2기존의 SVP 연구들은 데이터 품질, 레이블링, 불균형 문제를 데이터 준비 파이프라인에서 어떻게 해결하고 있는가?
  • RQ3현재 SVP 분야의 데이터 준비 실무 상태는 어떠한가? 그리고 다양한 연구 맥락 간에 어떻게 다름이 있는가?
  • RQ4문헌에서 여전히 부족하게 다루어지거나 충분히 해결되지 않은 데이터 준비 과제는 무엇인가?
  • RQ5향후 SVP 연구 및 산업 적용에서 데이터 품질 향상과 모델 신뢰성 강화를 위해 도출할 수 있는 권고 사항은 무엇인가?

주요 결과

  • 이 리뷰는 여섯 가지 주제로 분류된 16개의 고유한 데이터 준비 과제를 식별하였다: 데이터 가용성, 레이블링, 특징 공학, 데이터 불균형, 데이터 품질, 데이터 통합.
  • 데이터 부족과 일관되지 않은 레이블링이 가장 자주 보고된 과제였으며, 오직 38%의 연구에서 신뢰할 수 있는 출처에서 제공된 기준 레이블 데이터를 사용하였다.
  • 70% 이상의 연구에서 히우리스틱 또는 대체 레이블링 방법을 사용하였으며, 이는 레이블 노이즈로 인해 모델의 신뢰성이 저하될 수 있다.
  • 특징 공학이 가장 일반적인 해결 전략이었으며, 52%의 연구에서 정적 코드 메트릭(예: 순환 복잡도, 인지 복잡도)을 기반으로 하였다.
  • 데이터 불균형 문제에 대해선 오직 14%의 연구에서 명시적으로 다루었으며, 이는 모델 편향성과 성능 저하에 미치는 영향이 잘 알려져 있음에도 불구하고 그렇다.
  • 본 연구는 연구자 및 실무자들이 데이터 품질 향상에 기여할 수 있도록 12개의 실천 가능한 권고 사항을 제시하였다. 이는 표준화된 레이블링 프로토콜과 데이터 증강 기법을 포함한다.
Figure 2: The SVP data preparation pipeline.
Figure 2: The SVP data preparation pipeline.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.