Skip to main content
QUICK REVIEW

[論文レビュー] Common Vulnerability Scoring System Prediction based on Open Source Intelligence Information Sources

Philipp Kuehn, David N. Relke|arXiv (Cornell University)|Oct 5, 2022
Web Application Security Vulnerabilities被引用数 4
ひとこと要約

本稿では、NVDのような伝統的な脆弱性データベースを超えて、オープンソースインテリジェンス(OSINT)テキストを用いて共通脆弱性スコア評価システム(CVSS)ベクトルを予測するディーブラーニングアプローチを提案する。Webスクレイピングと関連するWebページ(ブログ、ニュース記事、パッチノートなど)の分析を通じて、NVDの記述とOSINTテキストを統合したモデルを訓練したが、OSINTデータ単体では顕著な改善が得られなかったものの、CVSSコンponent予測において最先端の性能を達成した。

ABSTRACT

The number of newly published vulnerabilities is constantly increasing. Until now, the information available when a new vulnerability is published is manually assessed by experts using a Common Vulnerability Scoring System (CVSS) vector and score. This assessment is time consuming and requires expertise. Various works already try to predict CVSS vectors or scores using machine learning based on the textual descriptions of the vulnerability to enable faster assessment. However, for this purpose, previous works only use the texts available in databases such as National Vulnerability Database. With this work, the publicly available web pages referenced in the National Vulnerability Database are analyzed and made available as sources of texts through web scraping. A Deep Learning based method for predicting the CVSS vector is implemented and evaluated. The present work provides a classification of the National Vulnerability Database's reference texts based on the suitability and crawlability of their texts. While we identified the overall influence of the additional texts is negligible, we outperformed the state-of-the-art with our Deep Learning prediction models.

研究の動機と目的

  • 伝統的な脆弱性データベース以外の公開Webソースが、CVSSベクトル予測を改善できるかどうかを調査すること。
  • 脆弱性を報告するOSINTソース(例:ブログ、ニュース、GitHub)を特定・分類すること。
  • NVD記述とスクレイピングしたOSINTテキストを併用して、CVSS予測用のディープラーニングモデルを構築・評価すること。
  • 自動脆弱性深刻度スコアリングのためのOSINTをトレーニングデータとして使用する可能性と品質を評価すること。
  • 標準化された指標を用いて、提案モデルの性能を既存の最先端手法と比較すること。

提案手法

  • NVDエントリに参照されているURLからテキストコンテンツを抽出するためにWebスクレイピングを適用し、ブログ、ニュースサイト、GitHubなどのドメインに焦点を当てた。
  • スクレイピングされたソースのテキストをフィルタリング・クリーニングし、公式のNVD脆弱性記述と統合してモデルトレーニングに使用した。
  • CVSSベクトルコンポonentのマルチラベル分類のためのコアディープラーニングアーキテクチャとして、ファインチューニングされたDistilBERTモデルを用いた。
  • MSE(平均二乗誤差)とMAE(平均絶対誤差)を含む複数のテストセットで、モデルのトレーニングと評価を実施した。
  • OSINTデータの影響を評価するため、NVDデータのみでトレーニングしたモデルとOSINTテキストを含むモデルを比較した。
  • 先行研究との比較評価を実施したが、モデルの可用性と指標の一貫性の欠如により、完全な再現性は阻害された。

実験結果

リサーチクエスチョン

  • RQ1伝統的な脆弱性データベース以外の場所で、脆弱性に関する関連するテキスト情報はどこに見つかるか(RQ1)?
  • RQ2脆弱性データベース以外の公開データソースが、CVSSベクトルの予測にどの程度適しているか(RQ2)?
  • RQ3OSINT由来のテキストは、NVDのみでトレーニングされたデータと比較して、CVSSベクトル予測の正確性を向上させられるか?
  • RQ4脆弱性関連のテキストデータを収集するのに最も信頼性がありクローリング可能なOSINTソースの種別は何か?
  • RQ5異なるディープラーニングモデルは、個々のCVSSベクトルコンポーネントおよび全体の深刻度スコアの予測において、どのように性能を発揮するか?

主な発見

  • 本研究では、NVDエントリから11,738件のユニークなURLを特定・分類し、コンテンツと利用可能性に基づき12の異なるカテゴリに分類した。
  • 広範なスクレイピングとOSINTテキストの統合にもかかわらず、追加データはモデル性能に統計的に有意な改善をもたらさなかった。
  • NVD記述のみを用いた場合、DistilBERTベースのモデルはDesc2022テストセットでMAE(平均絶対誤差)0.203という最先端の結果を達成した。
  • NVDとOSINTを併用してトレーニングしたモデルはMAE 0.248を記録したが、NVDのみのベースラインより優れておらず、この設定ではOSINTに明確な利点がないことが示された。
  • 結果から、OSINTソースはトレーニングに使用可能であるが、ノイズが多く一貫性に欠ける性質のため、モデルの正確性に与える影響が限定的である可能性が示唆された。
  • 本研究では、OSINTを用いたCVSS予測の潜在的価値を引き出すためには、より良いテキストフィルタリングとドメイン特化の事前学習が必要であると強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。