[論文レビュー] MLPdf: An Effective Machine Learning Based Approach for PDF Malware Detection
本稿では、約105,000件の実世界のPDFから抽出された48個の高品質な特徴を用いてPDFベースのマルウェアを検出する、多層パーセプトロン(MLP)ニューラルネットワークモデルであるMLPdfを提案する。このモデルは、たった0.08%の偽陽性率で95.12%の真正陽性率を達成し、8台の商用ウイルス対策スキャナーを著しく上回る性能を示した。
Due to the popularity of portable document format (PDF) and increasing number of vulnerabilities in major PDF viewer applications, malware writers continue to use it to deliver malware via web downloads, email attachments and other methods in both targeted and non-targeted attacks. The topic on how to effectively block malicious PDF documents has received huge research interests in both cyber security industry and academia with no sign of slowing down. In this paper, we propose a novel approach based on a multilayer perceptron (MLP) neural network model, termed MLPdf, for the detection of PDF based malware. More specifically, the MLPdf model uses a backpropagation algorithm with stochastic gradient decent search for model update. A group of high quality features are extracted from two real-world datasets which comprise around 105000 benign and malicious PDF documents. Evaluation results indicate that the proposed MLPdf approach exhibits excellent performance which significantly outperforms all evaluated eight well known commercial anti-virus scanners with a much higher true positive rate of 95.12% achieved while maintaining a very low false positive rate of 0.08%.
研究の動機と目的
- 広く使用されているPDFビューアーを介した社会的エンジニアリングやゼロデイ脆弱性を活用したPDFベースのマルウェア配布の増加する脅威に対処すること。
- オブスクリューション、ポリモルフィズム、ゼロデイ攻撃に対応できない、従来の署名ベースおよびサンドボックスベースの検出手法の限界を克服すること。
- 高い真正陽性率を維持しながら、極めて低い偽陽性率を実現できる機械学習モデルを構築すること。
- 実世界の状況下で、最先端の商用ウイルス対策スキャナーと比較して、モデルの性能を評価すること。
提案手法
- MLPdfモデルは、2つの隠れ層(それぞれ72ニューロン)と、二値分類(マルウェア/健全)のためのシグモイド活性化関数を用いた出力層を有する多層パーセプトロンを採用している。
- モデルの学習には、確率的勾配降下法を用い、過学習を防ぐためにドロップアウト率0.15を適用している。
- 各層にバッチ正規化を適用することで、層の入力の平均を0、分散を1に保つことで、学習の安定化と高速化を図っている。
- 過学習の監視とハイパーパrameter選定のため、学習データの20%を検証セットとして使用している。
- 105,000件の健全およびマルウェアPDFを含むデータセットを用い、バッチサイズ64で5,000エポックにわたり学習を実施している。
- 検出性能を最適化するために、確率閾値0.62が選択された。
実験結果
リサーチクエスチョン
- RQ1多層パーセプトロンに基づく機械学習モデルは、商用ウイルス対策スキャナーを上回る高い精度でマルウェアPDFを効果的に検出できるか?
- RQ2オブスクリューションまたはゼロデイ攻撃を受けるPDFマルウェアを検出する際、MLPdfモデルの真正陽性率および偽陽性率はどの程度の水準にあるか?
- RQ3ヒューリスティック法や署名ベース手法と比較して、手動で選別された高品質な特徴48個が、検出性能にどの程度の向上効果をもたらすか?
- RQ4MLPアーキテクチャにドロップアウトとバッチ正規化を適用することで、未学習のPDFサンプルに対する汎化性能と耐性が向上するか?
主な発見
- MLPdfモデルは、健全PDF 13,101件とマルウェアPDF 1,946件から成るテストセットにおいて、95.12%の真正陽性率を達成した。これは、最高の商用ウイルス対策スキャナーが達成した84.53%を著しく上回る。
- モデルは極めて低い偽陽性率0.08%を維持しており、これは13,101件の健全ファイルに対して10.4件の偽陽性に相当する。
- 偽陽性率が0.1%に達する条件下でも、モデルは95%の真正陽性率を達成しており、中程度の偽陽性率制約下でも優れた性能を示している。
- モデルの性能は、さまざまな確率閾値に対して安定しており、偽陽性率と偽陰性率の間には明確なトレードオフが見られた。
- 図6に示すように、MLPdfアプローチは、全8台の評価対象商用ウイルス対策スキャナーを、すべてのテスト閾値で上回った。
- 48個の高品質な特徴に加え、バッチ正規化とドロップアウトの適用により、モデルの強力な汎化性能と低過学習が実現された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。