[論文レビュー] Data Mining with Big Data in Intrusion Detection Systems: A Systematic Literature Review
本系統的文献レビューは、2013年から2018年までの期間にわたり、ビッグデータ対応インシデント検出システム(IDS)におけるデータマイニング技術(DMT)を32件の研究について分析し、意思決定木、ベイジアンネットワーク、k-means、SVM、およびANNが最も一般的に使用されたDMTであると判明した。本研究では、リアルタイム性能においてSparkがHadoopを上回ることを明らかにしたが、66%の実験がDARPAのような古くなったデータセットに依存しており、検出精度とリアルタイム攻撃分類の面で制限を受けることになった。
Cloud computing has become a powerful and indispensable technology for complex, high performance and scalable computation. The exponential expansion in the deployment of cloud technology has produced a massive amount of data from a variety of applications, resources and platforms. In turn, the rapid rate and volume of data creation has begun to pose significant challenges for data management and security. The design and deployment of intrusion detection systems (IDS) in the big data setting has, therefore, become a topic of importance. In this paper, we conduct a systematic literature review (SLR) of data mining techniques (DMT) used in IDS-based solutions through the period 2013-2018. We employed criterion-based, purposive sampling identifying 32 articles, which constitute the primary source of the present survey. After a careful investigation of these articles, we identified 17 separate DMTs deployed in an IDS context. This paper also presents the merits and disadvantages of the various works of current research that implemented DMTs and distributed streaming frameworks (DSF) to detect and/or prevent malicious attacks in a big data environment.
研究の動機と目的
- 2013年から2018年までのビッグデータ環境下におけるインシデント検出システム(IDS)で使用されたデータマイニング技術(DMT)を特定・分析すること。
- 既存のIDSソリューションで採用されているDMTおよび分散ストリーミングフレームワーク(DSF)の強みと弱みを評価すること。
- IDSにおけるDMTのパフォーマンスを検証するために使用された評価指標を調査し、ベンチマークにおける一貫性の欠如を評価すること。
- レビュー対象のIDSが標的としているサイバー攻撃の種別と、実験で使用されたデータセットの特徴を調査すること。
- 今後の研究に向けた提言を提供すること。特にリアルタイム検出、最新のデータセット、Sparkのような高性能ビッグデータツールの採用を強調すること。
提案手法
- キッチンヘムとチャーターズのフレームワークに従い、計画・実施・報告の各段階を含む系統的文献レビュー(SLR)を実施した。
- 6つのデジタル図書館(IEEE Xplore、ACM、Web of Science、Elsevier、Springer、Wiley)を検索し、初期に545件の論文を抽出した。
- 含む/除外基準および品質評価ルールを適用して関連する研究を絞り込み、分析対象として32件の主要論文を特定した。
- 意思決定木、ベイジアンネットワーク、k-means、SVM、および人工ニューラルネットワーク(ANN)を含むIDSで使用されたDMTを分類し、主成分分析(PCA)やカイ二乗検定といった特徴選択(FS)技術の有効性を評価した。
- Hadoop、Spark、Stormなどの分散ストリーミングフレームワーク(DSF)を分析し、リアルタイムインシデント検出におけるパフォーマンスを比較した。
- 評価指標(例:TPR、精度、FPR、TST、TRT)と攻撃分類能力を各研究でマッピングし、一貫性の欠如やギャップを特定した。
実験結果
リサーチクエスチョン
- RQ1ビッグデータにおけるIDSで使用されたデータマイニング技術は何か?
- RQ2文献で採用されているDMTおよびDSFの強みと弱みは何か?
- RQ3IDSにおけるDMTのパフォーマンスを検証するために使用された評価指標は何か?
- RQ4文献におけるIDSが標的としている攻撃の種別と、実験で使用されたデータセットの特徴は何か?
主な発見
- ビッグデータIDSで最も一般的に使用されたデータマイニング技術は、意思決定木、ベイジアンネットワーク、k-meansクラスタリング、人工ニューラルネットワーク(ANN)、およびサポートベクターマシン(SVM)である。
- 主成分分析(PCA)が最も頻繁に使用された特徴選択(FS)技術であったが、66%の研究がFSを実施しておらず、これはシステム効率の低下を招く可能性がある。
- Hadoopが最も広く使用された分散ストリーミングフレームワーク(DSF)であったが、Sparkはリアルタイム処理およびスケーラビリティにおいて優れたパフォーマンスを示した。
- 最も頻繁に報告された評価指標は、効率性の指標として真正陽性率(TPR)、精度(Acc)、偽陽性率(FPR)であり、パフォーマンスの指標として総処理時間(TST)、通信コスト(CC)、総応答時間(TRT)であった。
- 66%の実験が古くなったDARPAデータセットに依存しており、提案されたIDSソリューションの一般化可能性および実世界での有効性に悪影響を及ぼす可能性がある。
- 大多数の研究が攻撃を「通常」または「悪意ある」に分類するにとどまっており、リアルタイムでの特定攻撃タイプの分類能力に限界があり、細粒度の攻撃検出における重要なギャップが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。