Skip to main content
QUICK REVIEW

[논문 리뷰] Cleaning the NVD: Comprehensive Quality Assessment, Improvements, and Analyses

Afsah Anwar, Ahmed Abusnaina|arXiv (Cornell University)|2020. 06. 26.
Information and Cyber Security인용 수 8
한 줄 요약

이 논문은 National Vulnerability Database (NVD)의 핵심 데이터 품질 문제를 규명하고 수정한다. 이는 일관되지 않은 벤더/제품 이름, 정확하지 않은 공개 일자, 잘못된 CVSS v3 심각도 점수, 잘못 분류된 취약성 유형을 포함한다. 웹 스크래핑, 수동 검증, 딥러닝 기법을 활용해 저자들은 보다 정확한 NVD 데이터셋을 구축하였으며, 원본 데이터에 심각한 차이가 있음을 드러내어 연구자와 전문가의 보안 추세 분석 및 의사결정을 향상시켰다.

ABSTRACT

Vulnerability databases are vital sources of information on emergent software security concerns. Security professionals, from system administrators to developers to researchers, heavily depend on these databases to track vulnerabilities and analyze security trends. How reliable and accurate are these databases though? In this paper, we explore this question with the National Vulnerability Database (NVD), the U.S. government's repository of vulnerability information that arguably serves as the industry standard. Through a systematic investigation, we uncover inconsistent or incomplete data in the NVD that can impact its practical uses, affecting information such as the vulnerability publication dates, names of vendors and products affected, vulnerability severity scores, and vulnerability type categorizations. We explore the extent of these discrepancies and identify methods for automated corrections. Finally, we demonstrate the impact that these data issues can pose by comparing analyses using the original and our rectified versions of the NVD. Ultimately, our investigation of the NVD not only produces an improved source of vulnerability information, but also provides important insights and guidance for the security community on the curation and use of such data sources.

연구 동기 및 목표

  • National Vulnerability Database (NVD)의 데이터 품질 문제를 체계적으로 평가하여, 보편적으로 사용되는 취약성 정보 기준이 되는 NVD의 품질을 확보한다.
  • 취약성 게시 일자, 벤더 및 제품 이름, CVSS v3 심각도 점수, 취약성 유형 분류와 같은 핵심 필드의 일관성 부족 문제를 규명한다.
  • NVD의 이러한 데이터 품질 문제를 탐지하고 수정하기 위한 자동화되고 확장 가능한 방법을 개발한다.
  • 원본 데이터와 정제된 NVD 데이터를 비교한 사례 연구를 통해 데이터 품질이 보안 분석에 미치는 실제 영향을 입증한다.
  • 정제된 데이터셋과 수정 도구를 보안 커뮤니티 및 NIST와 공유하여 NVD의 장기적 향상에 기여한다.

제안 방법

  • NVD 항목에 연결된 참조 URL에서 공개 일자를 추출하기 위해 다중 소스 웹 스크래핑을 수행하였으며, URL의 도메인 수준 분석을 통해 약 85%의 URL에 대해 분석을 수행하였다.
  • 정제된 매핑 데이터베이스를 활용해 CPE 이름 일관성 문제를 탐지하고 해결하기 위한 벤더 및 제품 이름 일관성 도구를 개발하였다.
  • 취약성 기술적 설명 및 메타데이터를 기반으로 딥러닝 기반 모델을 구축하여 CVSS v3.1 심각도 점수를 예측하고 수정하였다.
  • 자동화된 수정 결과의 정확도를 평가하고 모델을 보완하기 위해 대표 샘플 항목에 대해 수동 검증을 수행하였다.
  • 수정된 필드를 기반으로 NVD 데이터셋을 재구성하고, 시간적 추세, 심각도 분포, 취약성 유형에 대한 비교 분석을 수행하였다.
  • 정제된 데이터셋과 도구를 NIST에 기부하여, 자유형 벤더 및 제품 필드를 제거하는 NVD 스키마 업데이트가 이루어졌다.

실험 결과

연구 질문

  • RQ1NVD의 취약성 공개 일자는 실제 공개 일자와 비교해 얼마나 정확한가?
  • RQ2일관되지 않은 벤더 및 제품 이름은 NVD의 신뢰성과 사용성에 어느 정도 영향을 미치는가?
  • RQ3CVSS v3.1 심각도 점수의 결함은 위험 우선순위 설정 및 복구 결정에 어떤 영향을 미치는가?
  • RQ4취약성 유형 분류의 데이터 품질 문제로 인해 취약성 추세 이해가 얼마나 왜곡되는가?
  • RQ5보안 연구 및 운영에서 원본 NVD 데이터를 사용할 경우와 정제된, 수정된 버전을 사용할 경우의 실질적 영향은 무엇인가?

주요 결과

  • 실제 공개와 NVD 게시 사이 평균 지연 기간은 47.6일에서 66.8일로, 취약성 심각도와 상관관계가 없어 데이터 수신의 체계적 지연을 시사한다.
  • 벤더 및 제품 이름의 일관성 문제는 광범위하게 존재하며, 인수 시간대와 표준화된 이름 체계를 통합함으로써 약 100%의 일관성 향상을 기대할 수 있다.
  • 수정된 CVSS v3.1 점수는 심각도 수준 간 균형 잡힌 분포를 보이며, 위험 평가의 일관성과 신뢰성 향상에 기여한다.
  • 정제된 데이터셋은 원본 NVD에 기재된 이외의 추가적인 취약성 유형을 식별하여 분류 정확도를 향상시켰다.
  • 사례 연구를 통해 공개 및 게시 시점의 시간적 분석에서 일주일 초반(월-화)에 공개가 이루어지고, NVD 게시가 일주일 후반에 이루어지는 패턴을 확인하여 복구 창의 추정에 영향을 주었다.
  • 본 연구 결과는 NIST가 NVD 스키마를 업데이트하여 자유형 벤더 및 제품 필드를 제거함으로써 향후 데이터 품질 문제를 줄이는 데 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.