Skip to main content
QUICK REVIEW

[論文レビュー] Learning detectors of malicious web requests for intrusion detection in network traffic

Lukáš Machlica, Karel Bartoš|arXiv (Cornell University)|Feb 8, 2017
Network Security and Intrusion Detection被引用数 6
ひとこと要約

この論文では、プロキシログから抽出した統計的特徴を用いて、シグネチャーやDNS、コンテンツ分析に依存せずに、C&C、フィッシング、クリックファウルトなどに特化したマルウェア通信を高精度に検出できるスケーラブルで学習ベースのシステムを提案する。本手法は、実際の企業ネットワークトラフィックにおいて、悪意ある通信、URL、感染ホストの検出で95%以上の精度を達成した。

ABSTRACT

This paper proposes a generic classification system designed to detect security threats based on the behavior of malware samples. The system relies on statistical features computed from proxy log fields to train detectors using a database of malware samples. The behavior detectors serve as basic reusable building blocks of the multi-level detection architecture. The detectors identify malicious communication exploiting encrypted URL strings and domains generated by a Domain Generation Algorithm (DGA) which are frequently used in Command and Control (C&C), phishing, and click fraud. Surprisingly, very precise detectors can be built given only a limited amount of information extracted from a single proxy log. This way, the computational requirements of the detectors are kept low which allows for deployment on a wide range of security devices and without depending on traffic context such as DNS logs, Whois records, webpage content, etc. Results on several weeks of live traffic from 100+ companies having 350k+ hosts show correct detection with a precision exceeding 95% of malicious flows, 95% of malicious URLs and 90% of infected hosts. In addition, a comparison with a signature and rule-based solution shows that our system is able to detect significant amount of new threats.

研究の動機と目的

  • 多様化・変種化するマルウェアやゼロデイマルウェアを検出する際の、シグネチャーベースおよびルールベースの手法の限界を克服すること。
  • 完全なトラフィック文脈を必要とせず、最小限のプロキシログデータから悪意ある行動を同定できる汎用的かつ再利用可能な検出アーキテクチャの開発。
  • 暗号化やオブスクリュート化されたURL、特にドメイン生成アルゴリズム(DGA)由来のものでさえも、プロキシログからの統計的特徴のみを用いて高精度に検出できる仕組みの構築。
  • 1つのプロキシログエントリから得られる、行動に依存しないコンactな特徴を学習データとして用いることで、誤検出と計算負荷の低減を実現。
  • 新しい脅威への迅速な適応を可能とするために、システム全体の再トレーニングを必要とせず、個々の検出器を段階的に再トレーニングできる仕組みの実装。

提案手法

  • URLパス、クエリ、ドメインなどのプロキシログフィールドから、文字頻度、n-gram分布、エントロピー、特殊文字の割合といった統計的特徴を抽出する。
  • ラベル付きのマルウェア通信サンプルのデータセットを用いてランダムフォレスト分類器を学習させ、DGA生成ドメインや暗号化URLを含む悪意あるパターンを検出する。
  • 各検出器が特定のマルウェア行動(例:C&C、フィッシング)に特化する多段階の検出器ハブを設計することで、精度の向上と誤検出の低減を実現。
  • DNS、WHOIS、Webページコンテンツを含めないプロキシログデータのみを用いることで、計算コストを低く抑え、幅広いセキュリティデバイスへの展開を可能にする。
  • 新しいサンプルの少量を用いて個々の検出器を段階的に再トレーニングできる仕組みを実装し、新規の脅威への迅速な適応を可能にする。
  • 既存のインシデント検知システムと統合し、トラフィック文脈分析と組み合わせることで、プロキシログベースの特徴による検出能力を強化する。

実験結果

リサーチクエスチョン

  • RQ1暗号化やDGA生成ドメインを用いる悪意あるWebトラフィックを、プロキシログからの統計的特徴のみを用いて高精度に検出できるか?
  • RQ2マルウェア固有でない汎用的特徴を用いる学習ベースのシステムは、シグネチャーベースの手法と比較して、ゼロデイまたは変種マルウェアの検出においてどの程度有効であるか?
  • RQ3外部の文脈を一切用いずに、プロキシログからの限定的な学習データのみで、検出器の性能を維持・向上できるか、その限界はどこか?
  • RQ4モジュラーで多段階の検出器アーキテクチャは、クラスタリングベースや文脈依存の検出手法と比較して、誤検出の低減と計算効率の向上をどの程度達成できるか?
  • RQ5個々の検出器の再トレーニングが可能であるという仕組みは、未確認のマルウェア行動に対しても、スケーラビリティと適応性をどのように向上させるか?

主な発見

  • 本システムは、実際の企業ネットワークトラフィックにおいて、悪意あるネットワーク通信、悪意あるURL、感染ホストの検出で95%以上の精度を達成した。
  • プロキシログ特徴のみを用いて、90%以上の感染ホストが正しく同定された。これは、大規模な環境下でも強力な検出能力を示している。
  • DNSログ、WHOISデータ、ドメインレピュテーションフィードに依存せずに、DGA生成ドメインを高精度に検出できた。
  • プロキシログからの統計的特徴の活用により、C&C、フィッシング、クリックファウルトキャンペーンで一般的に使われる暗号化またはオブスクリュート化されたURLの検出が可能になった。
  • 学習ベースのアプローチにより、従来のシグネチャーベースのソリューションよりも、未確認の脅威を顕著に検出できた。
  • モジュラーで多段階の検出器アーキテクチャにより、コンponentsを独立して再トレーニングできるため、最小限のデータで新しいマルウェア行動への迅速な適応が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。