Skip to main content
QUICK REVIEW

[論文レビュー] The Performance of Machine and Deep Learning Classifiers in Detecting Zero-Day Vulnerabilities

Faranak Abri, Sima Siami‐Namini|arXiv (Cornell University)|Nov 21, 2019
Network Security and Intrusion Detection参考文献 17被引用数 9
ひとこと要約

本論文は、悪意あるソフトウェアと良性ソフトウェアのデータセットを用いて10-fold交差検証を実施し、34種類の機械学習および深層学習分類器を用いてゼロデイマルウェアの検出を評価している。ランダムフォレスト分類器が99.51%の最高精度を達成し、深層学習モデルでさえもそれを上回った。これは、ゼロデイ脆弱性検出において、従来の機械学習が深層学習よりも効果的かつ効率的である可能性を示唆している。

ABSTRACT

The detection of zero-day attacks and vulnerabilities is a challenging problem. It is of utmost importance for network administrators to identify them with high accuracy. The higher the accuracy is, the more robust the defense mechanism will be. In an ideal scenario (i.e., 100% accuracy) the system can detect zero-day malware without being concerned about mistakenly tagging benign files as malware or enabling disruptive malicious code running as none-malicious ones. This paper investigates different machine learning algorithms to find out how well they can detect zero-day malware. Through the examination of 34 machine/deep learning classifiers, we found that the random forest classifier offered the best accuracy. The paper poses several research questions regarding the performance of machine and deep learning algorithms when detecting zero-day malware with zero rates for false positive and false negative.

研究の動機と目的

  • 最小限の偽陽性および偽陰性を伴うゼロデイマルウェア検出における、多様な機械学習および深層学習分類器の性能を評価すること。
  • 未知のマルウェアを同定する際、深層学習モデルが従来の機械学習アルゴリズムを上回るかを特定すること。
  • ゼロデイ脆弱性検出における、モデルの複雑さ、学習コスト、検出精度のトレードオフを評価すること。
  • 実世界でのシステム保護のためのゼロデイ脅威に対する効果的な分類器を特定すること。
  • 署名に依存せずに、学習ベースのモデルが高精度なゼロデイ検出を実現可能であるという実証的証拠を提供すること。

提案手法

  • 本研究では、従来の機械学習(例:SVM、ランダムフォレスト)、浅層ニューラルネットワーク、複数の隠れ層を持つ深層ニューラルネットワークを含む34種類の分類器を包括的に実験的に評価している。
  • モデルは10-fold交差検証を用いて学習および評価され、データセット全体にわたる頑健性と一般化性能が保証されている。
  • データセットは、ラベル付きのソフトウェアサンプル(良性およびゼロデイマルウェア)から構成され、分類器の学習およびテストに使用されている。
  • 性能は、標準指標(正確性、適合率、再現率、F1スコア、ROC-AUC)を用いて測定されており、偽陽性および偽陰性の低減が特に重視されている。
  • ハイパーパramータチューニングが深層学習モデルに適用されており、層の数、各層のニューロン数、バッチサイズを変更している。
  • 分析では、単純なマルチレイヤーパーセプトロン(MLP)から、最大7層を持つより深いネットワークまで、さまざまなアーキテクチャの性能を比較している。

実験結果

リサーチクエスチョン

  • RQ1従来の機械学習モデルは、ゼロデイマルウェア検出において深層学習モデルを上回ることができるか?
  • RQ2ゼロデイ脆弱性検出において、モデルの深さ、複雑さ、検出精度の最適なバランスは何か?
  • RQ3深層学習モデルは、偽陽性や偽陰性が存在しない状態で、99.5%以上(例:99.51%)の近似完全な精度を達成できるか、その程度はどの程度か?
  • RQ4異なる分類器タイプにおける偽陽性および偽陰性率はどのように変動するか?また、どのモデルが近似的にゼロの誤差率を達成できるか?
  • RQ5深層学習の高い学習コストは、ランダムフォレストのような単純なモデルよりも顕著な検出性能の向上をもたらすのだろうか?

主な発見

  • ランダムフォレスト分類器が99.51%の最高検出精度を達成し、テストされたすべての他のモデル(深層学習アーキテクチャを含む)を上回った。
  • 予想に反して、深層学習モデルは従来の機械学習モデルを顕著に上回らなかった。一部の深層ネットワークで200エポック経過後も99.33%の精度にとどまった。
  • 単純な深層学習モデル(例:30,1ニューロンを有するMLP)は、より深い・大きなモデル(例:100,80,60,40,20,10,1ニューロンを有するMLP)と同等の性能を示し、わずか0.26%の精度向上にとどまった。
  • どのモデルも100%の正確性を達成しなかったため、最良の分類器ですら一部のゼロデイマルウェアサンプルを誤分類していることが示された。
  • 従来の機械学習モデル、特にランダムフォレストは、深層学習モデルと比較して、低い学習コストと高速な推論性能を示し、優れた性能を発揮した。
  • 結果から、ランダムフォレストは高い正確性、低い偽陽性・偽陰性率、計算効率性を兼ね備えていることから、ゼロデイマルウェア検出においてより実用的かつ効果的な選択肢であると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。