[論文レビュー] CVE-driven Attack Technique Prediction with Semantic Information Extraction and a Domain-specific Language Model
本論文では、CVEとそれに対応するMITRE ATT&CKテクニックの大量で自動アノテーションされたデータセット上で微調整されたドメイン特化型言語モデル(SecureBERT)を用いたTTPpredictorを提案する。非構造化レポートから意味的役割ラベリング(SRL)を用いて脅威行動(SVO)を抽出し、動詞-目的語マッチングによりそれらをATT&CK機能と照合することで、CVEをTTPに分類する際、98%の正確性と95–98%のF1スコアを達成し、ChatGPTでさえも上回る性能を発揮した。
This paper addresses a critical challenge in cybersecurity: the gap between vulnerability information represented by Common Vulnerabilities and Exposures (CVEs) and the resulting cyberattack actions. CVEs provide insights into vulnerabilities, but often lack details on potential threat actions (tactics, techniques, and procedures, or TTPs) within the ATT&CK framework. This gap hinders accurate CVE categorization and proactive countermeasure initiation. The paper introduces the TTPpredictor tool, which uses innovative techniques to analyze CVE descriptions and infer plausible TTP attacks resulting from CVE exploitation. TTPpredictor overcomes challenges posed by limited labeled data and semantic disparities between CVE and TTP descriptions. It initially extracts threat actions from unstructured cyber threat reports using Semantic Role Labeling (SRL) techniques. These actions, along with their contextual attributes, are correlated with MITRE's attack functionality classes. This automated correlation facilitates the creation of labeled data, essential for categorizing novel threat actions into threat functionality classes and TTPs. The paper presents an empirical assessment, demonstrating TTPpredictor's effectiveness with accuracy rates of approximately 98% and F1-scores ranging from 95% to 98% in precise CVE classification to ATT&CK techniques. TTPpredictor outperforms state-of-the-art language model tools like ChatGPT. Overall, this paper offers a robust solution for linking CVEs to potential attack techniques, enhancing cybersecurity practitioners' ability to proactively identify and mitigate threats.
研究の動機と目的
- CVE記述とMITRE ATT&CK TTPの間の意味的ギャップを埋めること。これは、用語や文脈がしばしば不一致するためである。
- CVE-to-TTP分類モデルの学習に必要なラベル付きデータセットの不足に応えるために、大規模で自動アノテーションされたデータセットを構築すること。
- CVE-TTPマッピングに特化したドメイン特化型言語モデル(SecureBERT)を微調整し、分類性能を向上させること。
- 意味的役割ラベリングと機能マッピングを用いて、CVEを特定のATT&CKテクニックに正確かつ自動的に分類すること。
- ドメイン特化型の適応と意味的理解を通じて、一般向けLLM(例:ChatGPT)を上回るCVE-to-TTP分類の正確性を達成すること。
提案手法
- 意味的役割ラベリング(SRL)を用いて、非構造化されたサイバー脅威レポートから脅威行動(主語-動詞-目的語の三つ組)を抽出した。
- 抽出されたSVOを、動詞-目的語(VO)ペアを既知の攻撃パターンと照合することで、MITRE ATT&CKの脅威機能クラスと照合した。
- 文脈に配慮したSVOラベリングと機能マッピングを用いて、CVE記述とTTPをリンクした大規模で反復的かつ洗練されたデータセットを構築した。
- CVEとTTPの間の意味的および類型的関係を学習できるように、アノテーション済みデータセット上でドメイン特化型言語モデル(SecureBERT)を微調整した。
- 100,000以上の脅威文のコーパスを対象に反復的リファインメントを実施し、データ品質とモデルの汎化性能を向上させた。
- 分類の意味的正確性を向上させるために、SVO表現に文脈的属性(例:方法、目的)を統合した。
実験結果
リサーチクエスチョン
- RQ1意味的役割ラベリング(SRL)は、非構造化CVEレポートおよび脅威レポートから、実行可能な脅威表現(SVO)を効果的に抽出できるか?
- RQ2抽出されたSVOとMITRE ATT&CKテクニックとの間の動詞-目的語(VO)マッチングは、CVEをTTPに正確に自動ラベリング可能か?
- RQ3自動ラベル付きデータ上で微調整されたドメイン特化型言語モデル(SecureBERT)は、高精度なCVE-to-TTP分類を達成できるか?
- RQ4提案されたTTPpredictorモデルの性能は、ChatGPTなどの最先端一般向けLLMと比較して、CVE-TTP分類においてどのように差がつくか?
- RQ5意味的文脈(例:目的、方法)の統合は、TTP予測の正確性をどの程度向上させるか?
主な発見
- TTPpredictorは、対応するMITRE ATT&CKテクニックへのCVE分類において、平均98%の正確性を達成した。
- 異なるTTPカテゴリにおいて、F1スコアは95%から98%の範囲にあり、強固で一貫性のある性能を示した。
- 直接比較の結果、TTPpredictorは、同じ分類タスクで20%の正確性しか達成しなかったChatGPTを上回った。
- 100,000以上の脅威文のコーパスを対象とした反復的リファインメントプロセスは、データ品質とモデルの汎化性能を顕著に向上させた。
- SRLを用いてSVOを抽出し、それらをATT&CK機能にマッピングすることで、手動アノテーションなしに大規模な自動ラベル付きデータセットを構築できた。
- このデータセット上でSecureBERTを微調整した結果、従来の方法(例:47.84%のF1スコア)に比べて優れた性能を発揮した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。