[論文レビュー] Neural Classification of Malicious Scripts: A study with JavaScript and VBScript
本稿では、LSTMおよび1次元畳み込み(CPoLS)を用いてバイト列をエンドツーエンド処理する、悪意あるJavaScriptおよびVBScriptを分類する深層再帰ニューラルネットワークであるLaMPおよびCPoLSを提案する。最良のLaMPモデルは、296,274件のJavaScriptファイルに対して1.0%の偽陽性率で65.9%の真正陽性率を達成し、240,504件のVBScriptファイルに対しては69.3%のTPRを示した。これは、最小限の入力(最初の200文字)で高い精度を達成しており、高速でスケーラブルな検出を可能にする。
Malicious scripts are an important computer infection threat vector. Our analysis reveals that the two most prevalent types of malicious scripts include JavaScript and VBScript. The percentage of detected JavaScript attacks are on the rise. To address these threats, we investigate two deep recurrent models, LaMP (LSTM and Max Pooling) and CPoLS (Convoluted Partitioning of Long Sequences), which process JavaScript and VBScript as byte sequences. Lower layers capture the sequential nature of these byte sequences while higher layers classify the resulting embedding as malicious or benign. Unlike previously proposed solutions, our models are trained in an end-to-end fashion allowing discriminative training even for the sequential processing layers. Evaluating these models on a large corpus of 296,274 JavaScript files indicates that the best performing LaMP model has a 65.9% true positive rate (TPR) at a false positive rate (FPR) of 1.0%. Similarly, the best CPoLS model has a TPR of 45.3% at an FPR of 1.0%. LaMP and CPoLS yield a TPR of 69.3% and 67.9%, respectively, at an FPR of 1.0% on a collection of 240,504 VBScript files.
研究の動機と目的
- 標的型フィッシングおよびランサムウェア攻撃で広く見られる悪意あるJavaScriptおよびVBScriptの増加する脅威に対処すること。
- オブスクリュート化やアンパックされたスクリプトを検出できない、従来の静的および動的解析手法の限界を克服すること。
- 生のスクリプトバイト列から直接順序付き表現を学習する、エンドツーエンドで学習可能な深層学習モデルの開発。
- 最小限の入力(最初の200文字)で、実世界の大規模な良性および悪意あるスクリプトコーパスに対してモデルの性能を評価すること。
- 2つの新規アーキテクチャ—LaMP(LSTMおよびマックスプーリング)とCPoLS(長大なシーケンスの畳み込み分割)—のスクリプトマルウェア検出における有効性を比較すること。
提案手法
- モデルは生のスクリプトファイルをバイト列として処理し、各バイトを順序付き入力のトークンとして扱う。
- LaMPは2段階のアーキテクチャを採用する:まず、1つ以上のLSTM層がバイト列からの順序付き表現を学習し、次に、最終的な埋め込み表現を悪意あるか良性かに分類する全結合ニューラルネットワークが適用される。
- CPoLSはLaMPを拡張し、LSTMの前に1次元畳み込み層を追加して、長大なスクリプトシーケンスからの特徴を分割・抽出することで、長大なファイルの処理を改善する。
- 両モデルは教師あり学習を用いてエンドツーエンドで訓練され、言語モデルと分類のコンポonentの共同最適化が可能となる。
- モデルは、サンドボックス実行およびAVエンジン分析から得られたラベルを用いて、296,274件のJavaScriptおよび240,504件のVBScriptファイルからなる大規模コーパス上で評価された。
- モデルの性能は真正陽性率(TPR)および偽陽性率(FPR)で測定され、1.0% FPRの閾値での結果が報告された。
実験結果
リサーチクエスチョン
- RQ1エンドツーエンドで学習された深層再帰モデルは、生のバイト列から悪意あるJavaScriptおよびVBScriptを効果的に検出できるか?
- RQ2LaMPおよびCPoLSアーキテクチャは、大規模で実世界のスクリプトコーパスにおいて、性能でどのように比較されるか?
- RQ3スクリプトの最初の200文字のみを用いて、どの程度高い検出率を達成できるか?
- RQ4これらのモデルは、特徴工学やAPI抽出に依存する従来の静的および動的解析手法を上回ることができるか?
- RQ5LSTMおよび1次元畳み込みからの学習済み埋め込み表現は、悪意ある行動を示す特徴的なパターンを捉えているか?
主な発見
- 最良のLaMPモデルは、296,274件のJavaScriptファイルに対して1.0%の偽陽性率で65.9%の真正陽性率を達成した。
- 最良のCPoLSモデルは、同じJavaScriptコーパスに対して1.0%の偽陽性率で45.3%の真正陽性率を達成した。
- VBScriptファイルでは、LaMPモデルが1.0%の偽陽性率で69.3%の真正陽性率を達成し、CPoLSおよび他の比較モデルを上回った。
- CPoLSモデルは、VBScriptファイルに対して1.0%の偽陽性率で67.9%の真正陽性率を達成し、長大なシーケンスのモデリングにおいて優れた性能を示した。
- 両モデルとも、各スクリプトの最初の200文字のみを用いても高い検出精度を達成しており、生産環境での高速でスケーラブルな展開を可能にした。
- LaMPおよびCPoLSのエンドツーエンド学習により、すべての層で特徴を判別的に学習でき、固定または事前学習済み言語モデルよりも表現の質が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。