Skip to main content
QUICK REVIEW

[論文レビュー] An AI-based, Multi-stage detection system of banking botnets

Ling Li, Zhiqiang Gao|arXiv (Cornell University)|Jul 18, 2019
Spam and Phishing Detection参考文献 6被引用数 4
ひとこと要約

本論文は、サイバー・データレイクと深層学習モデル(特にLSTMネットワーク)を活用したAI駆動型マルチステージ検出システムを提示する。このシステムは、早期警告、DGA検出、フィッシングURL同定、DNSトンネル検出を実現する。ベースラインモデルと比較して誤検知率が10倍低減され、DGA検出のAUCスコアは0.9965、フィッシングURL分類のAUCスコアは0.9956を達成した。

ABSTRACT

Banking Trojans, botnets are primary drivers of financially-motivated cybercrime. In this paper, we first analyzed how an APT-based banking botnet works step by step through the whole lifecycle. Specifically, we present a multi-stage system that detects malicious banking botnet activities which potentially target the organizations. The system leverages Cyber Data Lake as well as multiple artificial intelligence techniques at different stages. The evaluation results using public datasets showed that Deep Learning based detections were highly successful compared with baseline models.

研究の動機と目的

  • 従来の検出手法では検出できないAPTベースの銀行ボットネットの脅威に対処し、最大498日にも及ぶドリフト時間の延長を防ぐ。
  • 高トラフィックネットワーク環境において極めて重要な誤検知率の低減を実現する。
  • 完全な侵害が発生する前に標的型フィッシングキャンペーンや悪意あるインfraストラクチャを早期に検出可能にする。
  • 統合された検出フレームワークとして、集中型サイバー・データレイクを活用し、LSTMやグラフ解析といった複数のAI技術を統合する。
  • 公開および内部の脅威データを用いた深層学習を活用し、サイバー・キルチェーンの複数段階にわたり検出精度を向上させる。

提案手法

  • 内部および外部ソースからの多様なセキュリティデータセットを統合・正規化・保存するための中央集約型プラットフォームとして、サイバー・データレイクを活用する。
  • サイバー・キルチェーン(CKC)モデルに準拠したマルチステージ検出パイプラインを採用し、レコネッサンス、デリバリー、エクスプロイテーション、C2、目的達成の各段階をカバーする。
  • ドメイン名の文字レベルシーケンスを用いて、LSTMネットワークを活用し、マルウェア生成ドメイン(DGA)か良性かを分類する。
  • 入力シーケンスを最大128文字までとするLSTMベースのモデルを用い、フィッシングURL検出を実施。文字埋め込みとドロップアウト(0.5)を活用し、正則化を実現する。
  • 過学習を防ぐために、訓練中に早期停止とハイパーパramータチューニングを実施。モデル評価には受信者操作特性曲線(ROC)とAUCを用いる。
  • 運用フェーズではホワイトリストおよびブラックリストを適用し、ノイズを低減し、検出精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1LSTMのような深層学習モデルは、従来のn-gramやbag-of-wordsベースラインと比較して、DGAおよびフィッシングURL検出における誤検知率を顕著に低減できるか?
  • RQ2サイバー・データレイクに基づくマルチステージ検出システムは、攻撃ライフサイクル全体(特に初期段階のレコネッサンス段階を含む)においてボットネット活動を検出できるか、その範囲はどの程度か?
  • RQ3公開データセットで学習させたLSTMベースのモデルは、AUCおよびFPR指標を用いて、悪意あるドメインおよびURLをどの程度正確に同定できるか?
  • RQ4LSTMやグラフ解析といったAI技術の統合は、銀行ボットネットキャンペーンにおける検出精度の向上とドリフト時間の短縮に寄与できるか?
  • RQ5高度な深層学習モデルと従来の機械学習モデルを比較した場合、検出率と誤検知率のトレードオフはどのように変化するか?

主な発見

  • LSTMモデルはDGA分類においてAUC 0.9965を達成し、ベースラインn-gramモデル(AUC 0.9610)を顕著に上回った。
  • フィッシングURL検出においては、LSTMモデルがAUC 0.9956を達成したのに対し、ベースラインbag-of-wordsモデルは0.9687であった。
  • 真正陽性率91%の条件下で、LSTMモデルの誤検知率はわずか0.7%であったのに対し、ベースラインモデルは同じ検出しきい値下で8%の誤検知率を示した。
  • 同等の検出率を維持した状態で、LSTMモデルはベースラインモデルと比較して誤検知数を10倍以上削減し、高トラフィック環境における実用的価値が明確に示された。
  • トレーニング履歴の分析から、エポックごとの検証性能が安定的かつ一貫的であることが確認され、LSTMモデルの過学習は発生しなかった。
  • GPUクラスタ上でハードウェア最適化されたLSTM推論を活用した結果、6倍の高速化が達成され、生産環境におけるスケーラブルな展開が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。