[論文レビュー] SCADS: A Scalable Approach Using Spark in Cloud for Host-based Intrusion Detection System with System Calls
本稿では、Google Cloud 上の Apache Spark を活用して Linux アプリケーションの大規模なシステムコールトレースを処理するスケーラブルなホストベースのインライン検出システム SCADS を提案する。Spark クラスタに計算を分散させ、n-gram 特徴抽出と TF-IDF 重み付けを用いることで、高い検出精度と線形スケーラビリティを達成し、従来の単一ホストアプローチに比べて、処理効率と大規模データワークロードへの適応性が優れている。
Following the current big data trend, the scale of real-time system call traces generated by Linux applications in a contemporary data center may increase excessively. Due to the deficiency of scalability, it is challenging for traditional host-based intrusion detection systems deployed on every single host to collect, maintain, and manipulate those large-scale accumulated system call traces. It is inflexible to build data mining models on one physical host that has static computing capability and limited storage capacity. To address this issue, we propose SCADS, a corresponding solution using Apache Spark in the Google cloud environment. A set of Spark algorithms are developed to achieve the computational scalability. The experiment results demonstrate that the efficiency of intrusion detection can be enhanced, which indicates that the proposed method can apply to the design of next-generation host-based intrusion detection systems with system calls.
研究の動機と目的
- 現代のデータセンタで生じる大規模なシステムコールトレースに対処できない、従来のホストベースのインライン検出システム(HIDS)のスケーラビリティ制限を解消すること。
- クラウドベースの分散コンピューティングを活用して、単一ホストシステムの計算およびストレージのボトルネックを克服すること。
- Apache Spark をクラウドインfraストラクチャと統合したスケーラブルなフレームワークを設計し、システムコールベースの HIDS のリアルタイム検出効率を向上させること。
- 実際のシステムコールトレースと標準的な機械学習分類器を用いて、提案フレームワークの性能とスケーラビリティを評価すること。
提案手法
- 複数の仮想マシンからの大規模なシステムコールトレースを処理するため、Google Cloud 上に Apache Spark を用いた分散コンピューティングフレームワークをデプロイする。
- 短いおよび長い範囲の行動パターンを捉えるために、複数長の n-gram 特徴抽出法を実装する。
- Spark の IDF モデルを用いて TF-IDF ベクトル化を実施し、頻度の高いが特徴のないシステムコールに過剰適合するのを防ぐことで、特徴表現と検出精度を向上させる。
- Spark のエグゼキューター上で並列処理が可能な分散機械学習分類器(特に LR-LBFGS および SVM)を活用して、処理を分散実行する。
- Dataproc API を用いて Spark クラスタを動的にスケーリングし、計算負荷の変化に応じた水平スケーラビリティと性能を評価する。
- n-gram の最大長を 1、6、10 として、複数長 n-gram 法を用いて、シーケンス長が検出性能に与える影響を評価する。
実験結果
リサーチクエスチョン
- RQ1クラウドベースで Spark ネイティブなフレームワークは、ホストベースのインライン検出のための大規模なシステムコールトレースの処理を効果的にスケーリングできるか?
- RQ2複数長 n-gram と単一長 n-gram の選択が、分散環境における検出精度にどのように影響するか?
- RQ3TF-IDF 特徴重み付けは、システムコールベースの HIDS において、単純な語句頻度(TF)と比較して、どの程度検出性能を向上させるか?
- RQ4Spark クラスタ上で分散実行された場合、LR-LBFGS と SVM の分類器は、精度と実行時間の点でどのように性能を発揮するか?
- RQ5Spark エグゼキューターの数が増加するに従って、提案フレームワークのスケーラビリティはどの程度向上するか?
主な発見
- LR-LBFGS 分類器を用いた場合、複数長 n-gram 法が単一長 n-gram 法よりも検出精度が高く、n 値が 1 から 10 の範囲で顕著に優れていた。
- Spark の IDF モデルで調整された TF-IDF 特徴ベクトルは、不安定な性能を示した原始的な TF ベクトルと比較して、顕著に検出精度が向上した。
- 最大 n-gram 長が 10 に設定された場合、LR-LBFGS 分類器は SVM 分類器よりも高い AUC 値を達成し、より長いシステムコールシーケンスに対して優れた一般化性能を示した。
- LR-LBFGS の場合、最大 n-gram 長が 5 を超えると AUC 値が頭打ちになり、SVM の場合は 3 を超えると同様の傾向を示した。これは、それ以上の長さでは利得が著しく減少することを示唆している。
- エグゼキューター数を 1 から 6 に増加させた場合、Spark エグゼキューターの平均タスク時間は著しく短縮され、SCADS フレームワークの強い線形スケーラビリティが裏付けられた。
- フレームワークは、妥当なスケーラビリティとパフォーマンスを達成しており、特に n=10 のような長い n-gram シーケンスを処理する際、LR-LBFGS 分類器が SVM よりも効率的であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。