[論文レビュー] Host-based anomaly detection using Eigentraces feature extraction and one-class classification on system call trace data
本稿では、主成分分析(PCA)を用いた特徴抽出のための Eigentraces を用いたホストベースの異常検出システムを提案する。システムコールトレースからの特徴抽出に Eigentraces を使用し、正常行動と異常行動を識別するための1クラス分類を適用する。ADFA-LD データセット上で評価した結果、高い検出精度と低い誤検出率を達成し、径路基底関数(RBF)ネットワークとランダムフォレストを用いた確率モデル化により、正常行動と攻撃行動を効果的に区別できることが示された。
This paper proposes a methodology for host-based anomaly detection using a semi-supervised algorithm namely one-class classifier combined with a PCA-based feature extraction technique called Eigentraces on system call trace data. The one-class classification is based on generating a set of artificial data using a reference distribution and combining the target class probability function with artificial class density function to estimate the target class density function through the Bayes formulation. The benchmark dataset, ADFA-LD, is employed for the simulation study. ADFA-LD dataset contains thousands of system call traces collected during various normal and attack processes for the Linux operating system environment. In order to pre-process and to extract features, windowing on the system call trace data followed by the principal component analysis which is named as Eigentraces is implemented. The target class probability function is modeled separately by Radial Basis Function neural network and Random Forest machine learners for performance comparison purposes. The simulation study showed that the proposed intrusion detection system offers high performance for detecting anomalies and normal activities with respect to a set of well-accepted metrics including detection rate, accuracy, and missed and false alarm rates.
研究の動機と目的
- システムコールトレースを用いたホストベースのインシデント検出のための半教師付き異常検出フレームワークの開発。
- 主成分分析(PCA)に基づく次元削減技術である Eigentraces を用いて、システムコールシーケンスの特徴表現を向上させること。
- ベイズ密度推定を用いた1クラス分類を適用し、正常行動をモデル化し、その逸脱を検出すること。
- 検出率、正解率、誤検出率、見逃し率といった標準的な指標を用いて性能を評価すること。
- 提案フレームワーク内での異なる確率推定器(RBFネットワークとランダムフォレスト)の有効性を比較すること。
提案手法
- Eigentraces は、まずトレースデータを固定サイズのウィンドウに分割し、各ウィンドウに対して主成分分析(PCA)を実行して主要な特徴を抽出することで、システムコールトレースデータに適用される。
- 得られた主成分は、ノイズと冗長性を低減した、システムコール行動のコンactかつ低次元の表現を形成する。
- 1クラス分類は、基準分布と人工データを組み合わせてターゲットクラスの密度関数を推定するベイズ式の定式化を用いて実装される。
- ターゲットクラスの確率関数は、2つの機械学習モデルである径路基底関数(RBF)ニューラルネットワークとランダムフォレストを用いてモデル化される。
- ラベル付きの異常データが存在しない状況において、正常クラスの密度推定を高めるために、基準分布に基づいて人工データが生成される。
- 最終的な異常検出意思決定は、新しいシステムコールトレースの推定密度を学習済みの正常密度のしきい値と比較することによって行われる。
実験結果
リサーチクエスチョン
- RQ1Eigentraces は、異常検出のための判別的特徴を、システムコールトレースから効果的に抽出できるか?
- RQ2正常トレーニングデータのみが利用可能な状況で、ベイズ密度推定を用いた1クラス分類は、異常をどれほど効果的に検出できるか?
- RQ3RBFネットワークとランダムフォレストの間で、正常行動の密度関数モデル化において、性能にどのような差が生じるか?
- RQ4提案手法は、実際のシステムコールトレースデータにおいて、誤検出率と見逃し検出率をどれほど低減できるか?
- RQ5PCAに基づく特徴抽出と1クラス分類の統合は、半教師付き設定において高い検出精度を達成できるか?
主な発見
- 提案システムは、ADFA-LD ベンチマークデータセットで高い検出率を達成し、性能指標から強力な異常検出能力を示した。
- Eigentraces の使用により、PCA を用いてシステムコールシーケンス内の主要なパターンを捉えることで、特徴表現が顕著に向上した。
- ベイズ密度推定を用いた1クラス分類は、正常行動を効果的にモデル化し、その逸脱を信頼性高く検出できた。
- 報告されたシミュレーション研究において、RBFニューラルネットワークはランダムフォレストを上回り、検出率と誤検出率の両面で優れた性能を示した。
- システムは低い誤検出率と見逃し検出率を示し、正常行動と異常行動を効果的に区別できる、耐障害性と信頼性の高い性能を示した。
- Eigentraces と1クラス分類の統合により、リアルタイムのホストベースのインシデント検出に適したコンactで効率的なモデルが実現された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。