Skip to main content
QUICK REVIEW

[論文レビュー] Robust Neural Malware Detection Models for Emulation Sequence Learning

Rakshit Agrawal, Jack W. Stokes|arXiv (Cornell University)|Jun 28, 2018
Advanced Malware Detection Techniques参考文献 29被引用数 5
ひとこと要約

本論文は、長時間にわたるAPIコールのエミュレーションシーケンスを分析するため、LSTMと畳み込みニューラルネットワーク(CNN)を活用した耐障害性の高いマルウェア検出モデルを提案する。これにより、マルウェアの行動が長大なシーケンス内に深く隠されている場合でも、多様な変種マルウェア(ポリモーマルマルウェア)を検出可能となる。主な貢献は、長大なシーケンス(最大数十万件のイベントまで)を高精度で処理できる「長大シーケンスの畳み込み的分割法(CPoLS)」の導入であり、634,249件のシーケンスから成るデータセットにおいて、エンドツーエンドの学習が可能であることを示している。

ABSTRACT

Malicious software, or malware, presents a continuously evolving challenge in computer security. These embedded snippets of code in the form of malicious files or hidden within legitimate files cause a major risk to systems with their ability to run malicious command sequences. Malware authors even use polymorphism to reorder these commands and create several malicious variations. However, if executed in a secure environment, one can perform early malware detection on emulated command sequences. The models presented in this paper leverage this sequential data derived via emulation in order to perform Neural Malware Detection. These models target the core of the malicious operation by learning the presence and pattern of co-occurrence of malicious event actions from within these sequences. Our models can capture entire event sequences and be trained directly using the known target labels. These end-to-end learning models are powered by two commonly used structures - Long Short-Term Memory (LSTM) Networks and Convolutional Neural Networks (CNNs). Previously proposed sequential malware classification models process no more than 200 events. Attackers can evade detection by delaying any malicious activity beyond the beginning of the file. We present specialized models that can handle extremely long sequences while successfully performing malware detection in an efficient way. We present an implementation of the Convoluted Partitioning of Long Sequences approach in order to tackle this vulnerability and operate on long sequences. We present our results on a large dataset consisting of 634,249 file sequences, with extremely long file sequences.

研究の動機と目的

  • エミュレーションからの行動的シーケンスを分析することで、従来の署名ベース手法を回避する多様な変種マルウェアを検出する挑戦に応える。
  • 従来のモデルが短いシーケンス(例:≤200イベント)しか処理できないという制限を克服し、攻撃者が長大なシーケンス内に悪意ある行動を深く隠すのを防ぐ。
  • シーケンスの切り出しや文脈の損失なしに、変動する長さのイベントシーケンス全体から学習可能なエンドツーエンドのニューラルモデルを開発する。
  • マルウェアがコマンドの再順序化、ループ、または難読化技術を用いて検出を回避するのに対しても、検出の耐障害性を向上させる。
  • 長大なシーケンスにおいて、順序依存性をモデル化するLSTMと、局所的なイベントパターンを検出するCNNを組み合わせた手法の有効性を示す。

提案手法

  • イベントシーケンス内の長距離依存関係をモデル化するためのLSTMネットワークと、悪意あるイベントの局所的パターンを検出するためのCNNを組み合わせたハイブリッドアーキテクチャを採用する。
  • 長大なシーケンスを重複する管理可能なチャンクに分割しつつも、順序的文脈を保持する「長大シーケンスの畳み込み的分割法(CPoLS)」技術を導入する。
  • 各チャンクから局所的特徴を抽出するためのチャンク単位の畳み込み処理パイプラインを用い、その後にチャンク間の順序依存性をLSTMベースでモデル化する。
  • マルウェア分類の主損失に加え、勾配伝搬を促進するための補助損失を含む複数の目的を統合した、エンドツーエンドの最適化戦略を実装する。
  • システムコールの密集表現を学習可能とするためのイベント埋め込み層を導入し、APIイベント間の意味的関係を捉える。
  • 可変的で極端な長さのシーケンスを効率的に処理するため、動的かつ固定サイズの重複セグメントに分割する「Chunkify」アプローチを考案する。

実験結果

リサーチクエスチョン

  • RQ1標準的なRNNの処理能力を超える長大なAPIコールシーケンスにおいて、ニューラルモデルがマルウェアを効果的に検出できるか?
  • RQ2CPoLS手法は、長大なシーケンスの効率的処理を可能にしつつも、順序的文脈をどのように保持しているか?
  • RQ3短いシーケンスに制限されたモデルと比較して、ハイブリッドLSTM-CNNモデルは検出精度をどの程度向上させるか?
  • RQ4エンドツーエンド学習フレームワークにおける補助損失は、多様な変種マルウェアに対するモデルの耐障害性と一般化性能を向上させるか?
  • RQ5部分的またはサンプリングベースの手法と比較して、全長シーケンス学習アプローチは、遅延する悪意ある行動を示すスパイクマルウェアをどの程度効果的に検出できるか?

主な発見

  • 提案されたモデルは、634,249件のファイルシーケンスから成る大規模データセットにおいて高い検出精度を達成し、全長シーケンスにおけるエンドツーエンド学習の可能性を示した。
  • CPoLS手法により、悪意あるイベントがシーケンスの深部に存在する場合でもマルウェア検出が可能となり、短い入力長に制限されたモデルの限界を克服した。
  • ハイブリッドLSTM-CNNアーキテクチャは、マルウェア検出に不可欠な局所的イベントパターンと長距離依存関係の両方を効果的に捉えることができ、ベースラインモデルを上回った。
  • AoLLモデルにおける複数の目的と補助損失の活用により、勾配伝搬が促進され、モデルの収束性と耐障害性が向上した。
  • Chunkifyアプローチにより、長さが可変的で極端なシーケンスの処理が効率的に行えるようになったが、シーケンスの断片化なしに高い性能を維持した。
  • モデルは、コマンドの再順序化や良性コマンドの挿入といった多様な変種変更に対しても、全シーケンスにわたる同時発生パターンの学習能力により、耐障害性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。