Skip to main content
QUICK REVIEW

[論文レビュー] STIXnet: A Novel and Modular Solution for Extracting All STIX Objects in CTI Reports

Francesco Marchiori, Mauro Conti|arXiv (Cornell University)|Mar 17, 2023
Software Engineering Research被引用数 4
ひとこと要約

STIXnet は、非構造化されたサイバー脅威インテリジェンス(CTI)レポートから、すべての構造化脅威インテリジェンス表現(STIX)エンティティおよび関係を自動抽出するための新規でモジュラーなフレームワークである。自然言語処理(NLP)、ルールベース手法、および動的知識ベースを統合することで、エンティティ抽出の F1 スコアが 0.916、関係抽出の F1 スコアが 0.724 という最先端の性能を達成し、スケーラブルで拡張可能なパイプラインとして、STIX で標準化されたすべてのオブジェクトタイプと関係をサポートする。

ABSTRACT

The automatic extraction of information from Cyber Threat Intelligence (CTI) reports is crucial in risk management. The increased frequency of the publications of these reports has led researchers to develop new systems for automatically recovering different types of entities and relations from textual data. Most state-of-the-art models leverage Natural Language Processing (NLP) techniques, which perform greatly in extracting a few types of entities at a time but cannot detect heterogeneous data or their relations. Furthermore, several paradigms, such as STIX, have become de facto standards in the CTI community and dictate a formal categorization of different entities and relations to enable organizations to share data consistently. This paper presents STIXnet, the first solution for the automated extraction of all STIX entities and relationships in CTI reports. Through the use of NLP techniques and an interactive Knowledge Base (KB) of entities, our approach obtains F1 scores comparable to state-of-the-art models for entity extraction (0.916) and relation extraction (0.724) while considering significantly more types of entities and relations. Moreover, STIXnet constitutes a modular and extensible framework that manages and coordinates different modules to merge their contributions uniquely and exhaustively. With our approach, researchers and organizations can extend their Information Extraction (IE) capabilities by integrating the efforts of several techniques without needing to develop new tools from scratch.

研究の動機と目的

  • 増加する頻度の高い CTI レポートから、多様なサイバー脅威インテリジェンスを手作業で抽出するという課題に対処すること。
  • 既存の NLP モデルが一部の STIX エンティティおよび関係しか抽出できず、相互運用性に欠けるという限界を克服すること。
  • すべてのエンティティおよび関係タイプにおいて STIX 標準に完全準拠する、モジュラーで拡張可能なフレームワークを構築すること。
  • 誤分類されたエンティティのフィルタリングを可能にすることで、モジュール間の誤り伝播を低減し、独立した評価を可能にすること。
  • 脅威アナリストが抽出されたインテリジェンスを知識グラフとして可視化・探索できる、スケーラブルでインタラクティブなシステムを提供すること。

提案手法

  • STIXnet は、エンティティ抽出、関係抽出、知識ベース統合を独立した組み換え可能なコンポONENTに分離したモジュラーなパイプラインアーキテクチャを採用している。
  • エンティティ抽出では、事前学習済み NLP モデル(例:spaCy、BERT ベースのモデル)に加え、ルールベースの正規表現と動的知識ベース(KB)を用いてエンティティの正規化および意味の解消を実現している。
  • 関係抽出にはハイブリッドアプローチを採用:文の埋め込みに基づくディープラーニングモデルとルールベースシステムを併用し、信頼度スコアを [0,1] の範囲に正規化してしきい値処理(0.5 に設定)を実施している。
  • 信頼度しきい値 0.5 を適用することで、誤検出を低減しつつ再現率を維持している。
  • システムはグラフィカルインターフェースを用いて、ノードが STIX オブジェクト、エッジが関係を表す知識グラフとして結果を可視化しており、KB からの拡張可能なメタデータを含む。
  • 知識ベースはレポート処理毎に段階的に拡充され、継続的学習と時間経過に伴うモデル一般化の向上を可能にする。

実験結果

リサーチクエスチョン

  • RQ1モジュラーで拡張可能なフレームワークは、非構造化 CTI レポートからすべての STIX 標準エンティティおよび関係を高精度に抽出できるか?
  • RQ2NLP、ルールベース論理、および動的知識ベースの統合は、モノリシックモデルと比較して、抽出精度とカバレッジをどのように向上させるか?
  • RQ3エンティティ抽出から関係抽出への誤り伝播が性能に与える影響はどの程度で、それを軽減できるか?
  • RQ4ハイブリッド DL およびルールベースシステムにおいて、精度と再現率のバランスを最適化する信頼度しきい値は何か?
  • RQ5このフレームワークは、進化する脅威インテリジェンスのニーズに対応するためのリアルタイム更新と拡張性を備えているか?

主な発見

  • STIXnet はエンティティ抽出で F1 スコア 0.916 を達成し、幅広い STIX オブジェクトタイプをサポートしているにもかかわらず、最先端のモデルと同等の性能を示している。
  • 関係抽出モジュールは F1 スコア 0.724 を達成し、CTI レポートに含まれる複雑で多様な関係に対しても高い性能を示している。
  • 誤分類されたエンティティを除外することで誤り伝播を緩和したところ、精度は 0.721 から 0.828 に向上したが、真陽性数の減少により再現率が低下した。
  • 関係抽出における最適な信頼度しきい値は 0.5 であり、誤検出と誤検出のバランスを良好に保っている。
  • モジュラー設計により、新しい抽出モジュールをプラグアンドプレイで統合可能であり、特定の脅威インテリジェンスユースケースにカスタマイズ可能である。
  • 動的知識ベースにより、処理されるレポートの度に継続的に拡充され、長期的なシステムの改善を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。