Skip to main content
QUICK REVIEW

[論文レビュー] Generating Cyber Threat Intelligence to Discover Potential Security Threats Using Classification and Topic Modeling

Md Imran Hossen, Ashraful Islam|arXiv (Cornell University)|Aug 15, 2021
Cybercrime and Law Enforcement Studies被引用数 4
ひとこと要約

本稿では、実際のハッキングフォーラムからのデータを用いて教師あり分類と非教師ありトピックモデリングを組み合わせることで、自動的にサイバー脅威インテリジェンス(CTI)を生成するフレームワークを提案する。二値および多値分類のデータセットを構築し、複数の分類器(深層学習モデルを含む)を評価し、LDAおよびNMFを用いてトピックを発見することで、脅威検出において高いパフォーマンスと意味のある脅威分類を達成した。

ABSTRACT

Due to the variety of cyber-attacks or threats, the cybersecurity community enhances the traditional security control mechanisms to an advanced level so that automated tools can encounter potential security threats. Very recently, Cyber Threat Intelligence (CTI) has been presented as one of the proactive and robust mechanisms because of its automated cybersecurity threat prediction. Generally, CTI collects and analyses data from various sources e.g., online security forums, social media where cyber enthusiasts, analysts, even cybercriminals discuss cyber or computer security-related topics and discovers potential threats based on the analysis. As the manual analysis of every such discussion (posts on online platforms) is time-consuming, inefficient, and susceptible to errors, CTI as an automated tool can perform uniquely to detect cyber threats. In this paper, we identify and explore relevant CTI from hacker forums utilizing different supervised (classification) and unsupervised learning (topic modeling) techniques. To this end, we collect data from a real hacker forum and constructed two datasets: a binary dataset and a multi-class dataset. We then apply several classifiers along with deep neural network-based classifiers and use them on the datasets to compare their performances. We also employ the classifiers on a labeled leaked dataset as our ground truth. We further explore the datasets using unsupervised techniques. For this purpose, we leverage two topic modeling algorithms namely Latent Dirichlet Allocation (LDA) and Non-negative Matrix Factorization (NMF).

研究の動機と目的

  • オンラインフォーラムにおける膨大な量の非構造的脅威関連議論を手動で分析する課題に対処すること。
  • ハッキングフォーラムのコンテンツからサイバー脅威を抽出・分類する自動システムを構築し、能動的な脅威インテリジェンスを提供すること。
  • 教師ありおよび非教師あり機械学習技術を活用することで、脅威検出の効率性と正確性を向上させること。
  • 非構造的セキュリティフォーラムデータのトピックモデリングを通じて、新規のサイバー脅威を早期に特定すること。

提案手法

  • ハッキングフォーラムから実世界のデータを収集し、二値(脅威対象 vs. 非脅威対象)および多値分類(分類済み脅威)のラベル付きデータセットを構築した。
  • 伝統的な機械学習モデルおよびディープニューラルネットワークを含む複数の教師あり分類器を適用し、脅威コンテンツを分類した。
  • 隠れた脅威トピックを特定するために、潜在的ディリクレ割り当て(LDA)および非負値行列分解(NMF)を用いた非教師ありトピックモデリングを実施した。
  • 分類精度の妥当性を検証するため、ラベル付きの漏洩データセットを基準としてモデルのパフォーマンスを評価した。
  • 分類とトピックモデリングを統合し、非構造的テキストソースから実用的なサイバー脅威インテリジェンスを生成した。
  • 標準的な自然言語処理(NLP)の前処理および埋め込み技術を用いて、分類およびトピックモデリングの両タスクに適したテキストデータを準備した。

実験結果

リサーチクエスチョン

  • RQ1さまざまな教師あり分類器は、ハッキングフォーラム議論におけるサイバー脅威関連コンテンツと非脅威コンテンツをどれほど効果的に区別できるか?
  • RQ2LDAやNMFのようなトピックモデリング技術は、非構造的フォーラムデータから意味的で実用的な脅威カテゴリをどれほど効果的に特定できるか?
  • RQ3分類とトピックモデリングの統合は、生成されたサイバー脅威インテリジェンスの全体的な品質と実用性をどのように向上させるか?
  • RQ4ディープラーニングベースの分類器は、従来のモデルと比較して、フォーラムテキストからのサイバー脅威検出においてどの程度のパフォーマンスを示すか?
  • RQ5基準となる真値として機能するホールドアウト済みラベル付きデータセット上で、モデルの一般化性能はどの程度高いか?

主な発見

  • 提案されたフレームワークは、脅威検出において高い分類精度を達成した。特に、深層ニューラルネットワークモデルが二値および多値分類の両データセットで伝統的モデルを上回った。
  • LDAおよびNMFは、マルウェア配布やゼロデイエクスプロイトの議論など、整合性があり意味的に明確な脅威トピックを効果的に特定した。
  • 多値分類モデルは、脅威を明確なタイプに分類する能力に優れており、より詳細な脅威インテリジェンスの提供が可能になった。
  • トピックモデリングと分類の統合により、検出された脅威が特定のテーマクラスタに関連付けられ、解釈可能性が向上した。
  • ラベル付き漏洩データセットを真値として用いることで、モデル予測の信頼性と妥当性が確認された。
  • 特にニッチな脅威カテゴリの特定において、LDAに比べてNMFがより高いトピックの整合性と解釈可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。