[論文レビュー] Forecasting Cyber Attacks with Imbalanced Data Sets and Different Time Granularities
本論文は、TwitterとGDELTからの非伝統的信号を活用し、時間分解能を可変とする($t_x$ を信号用、$t_g$ を正例用に使用)ベイジアンネットワークベースのフレームワークを提案する。このフレームワークにより、匿名化された組織を標的としたサイバー攻撃を予測する。また、AUC性能を顕著に向上させる新規ハイブリッドオーバーサンプリング手法SMOTE++を導入し、マルウェア、改ざん、DOS、悪意あるメール/URL攻撃において最大70%のAUCを達成した。これは、極めて不均衡なサイバーセキュリティ脅威データセットにおいて顕著な成果である。
If cyber incidents are predicted a reasonable amount of time before they occur, defensive actions to prevent their destructive effects could be planned. Unfortunately, most of the time we do not have enough observables of the malicious activities before they are already under way. Therefore, this work suggests to use unconventional signals extracted from various data sources with different time granularities to predict cyber incidents for target entities. A Bayesian network is used to predict cyber attacks where the unconventional signals are used as indicative random variables. This work also develops a novel minority class over sampling technique to improve cyber attack prediction on imbalanced data sets. The results show that depending on the selected time granularity, the unconventional signals are able to predict cyber attacks for the anonimyzed target organization even though the signals are not explicitly related to that organization. Furthermore, the minority over sampling approach developed achieves better performance compared to the existing filtering techniques in the literature.
研究の動機と目的
- 直接的なネットワーク観測値ではなく、間接的で非伝統的な信号を用いて、事前にサイバー攻撃を予測すること。
- 信号用($t_x$)と正例用($t_g$)の異なる時間分解能が、予測性能に与える影響を調査すること。
- 少数クラスの予測を向上させるために、不均衡なサイバーセキュリティ脅威データセットの課題に対処すること。
- 一般化性能を向上させるために、アンダーサンプリング、合成少数クラス生成、およびインスタンス再重み付けを統合した新規オーバーサンプリング手法SMOTE++の開発と評価。
提案手法
- リアルタイムで世界のメディアやソーシャルディス course を監視するTwitterとGDELTから、非伝統的信号を抽出する。
- 時間窓 $t_x$(例:1日、3日、1週間)を変化させることで、信号を集約し、時間的傾向を捉える。
- 時間窓 $t_g$(例:12、24、48時間)で標的となるエンティティの正例イベントを定義し、ラベル付きのトレーニングおよびテストセットを作成する。
- ベイジアンネットワークを用いて、非伝統的信号とサイバー攻撃結果との間の確率的依存関係をモデル化する。
- マジョリティクラスのアンダーサンプリング、少数クラスの合成インスタンス生成、およびインスタンス再重み付けを統合したハイブリッドオーバーサンプリング手法SMOTE++を開発する。
- 複数の攻撃タイプと時間分解能の組み合わせにおいて、AUCとF1スコアを用いてモデルの性能を評価する。
実験結果
リサーチクエスチョン
- RQ1直接的に標的組織に関係のない、ソーシャルメディアやグローバルニュースソースからの非伝統的信号でも、その組織のサイバー攻撃を予測できるか?
- RQ2信号用($t_x$)と正例用($t_g$)の異なる時間分解能が、サイバー攻撃予測モデルの予測性能にどのように影響するか?
- RQ3提案されたSMOTE++オーバーサンプリング手法は、従来のフィルタリング手法と比較して、不均衡なサイバーセキュリティ脅威データセットにおける予測性能を向上させるか?
- RQ4GEM、GET、GEAなどの非伝統的信号のうち、特定のサイバー攻撃タイプに対して最も示唆的であるものは何か?
- RQ5SMOTE++による性能向上は、異なる攻撃タイプおよび時間分解能設定において統計的に有意であるか?
主な発見
- ベイジアンネットワークモデルは、TwitterとGDELTからの非伝統的信号のみを用いても、マルウェア、改ざん、DOS、悪意あるメール/URL攻撃の予測において最大70%のAUCを達成した。
- GEM、GET、GEAの信号は、すべての攻撃タイプにおいて、他の信号よりも一貫してサイバーインcidンツの兆候として顕著であった。
- SMOTE++は、すべての攻撃タイプにおいてSMOTEおよびRandomSubsampleを上回るAUC性能を示し、$t_g = 12$または$48$時間の設定では統計的に有意な改善が得られた。
- 最適な時間分解能($t_x$ および $t_g$)は攻撃タイプによって異なり、頻度の高い攻撃では短い $t_g$ 値(12〜24時間)がより高い性能を示した。
- 同じ信号に対して異なる $t_x$ 値を使用することでモデル性能が向上したため、信号集約窓の選定が予測力に大きく影響することが示された。
- SMOTE++手法により、クラスの偏りが著しいデータセットにおいても、モデルは高い性能を維持した。これは、SMOTE++による手法的整合性のおかげである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。