Skip to main content
QUICK REVIEW

[論文レビュー] Binary Black-box Evasion Attacks Against Deep Learning-based Static Malware Detectors with Adversarial Byte-Level Language Model

Mohammadreza Ebrahimi, Ning Zhang|arXiv (Cornell University)|Dec 14, 2020
Adversarial Robustness in Machine Learning参考文献 30被引用数 19
ひとこと要約

本稿では、バイナリ実行ファイルのバイトレベル言語モデルを学習するシーケンス・ツー・シーケンスRNNを用いて、悪意あるマルウェアの変種を生成するブラックボックス敵対的攻撃フレームワークであるMalRNNを提案する。モデルの勾配情報、信頼度スコア、動的解析を一切必要としないが、8つのマルウェアカテゴリにわたり3つのディープラーニングベースのマルウェア検出器を効果的に回避し、バックドア標本では最大54.28%の回避率を達成した。

ABSTRACT

Anti-malware engines are the first line of defense against malicious software. While widely used, feature engineering-based anti-malware engines are vulnerable to unseen (zero-day) attacks. Recently, deep learning-based static anti-malware detectors have achieved success in identifying unseen attacks without requiring feature engineering and dynamic analysis. However, these detectors are susceptible to malware variants with slight perturbations, known as adversarial examples. Generating effective adversarial examples is useful to reveal the vulnerabilities of such systems. Current methods for launching such attacks require accessing either the specifications of the targeted anti-malware model, the confidence score of the anti-malware response, or dynamic malware analysis, which are either unrealistic or expensive. We propose MalRNN, a novel deep learning-based approach to automatically generate evasive malware variants without any of these restrictions. Our approach features an adversarial example generation process, which learns a language model via a generative sequence-to-sequence recurrent neural network to augment malware binaries. MalRNN effectively evades three recent deep learning-based malware detectors and outperforms current benchmark methods. Findings from applying our MalRNN on a real dataset with eight malware categories are discussed.

研究の動機と目的

  • モデル固有の知識を必要とせず、ディープラーニングベースの静的マルウェア検出器に対する自動的でブラックボックスの回避攻撃を開発すること。
  • 勾配情報、信頼度スコア、または動的解析に依存する既存の敵対的例生成手法の限界を克服すること。
  • 生のバイナリシーケンス上で訓練された生成的RNNを用いて、スケーラブルかつ大規模に回避可能なマルウェア変種を生成すること。
  • 現実的でブラックボックスな設定下で、追加型(付加型)の敵対的攻撃が最先端のDLベースのマルウェア検出器に与える脆弱性を評価すること。
  • 深層学習ベースのアンチマルウェアシステムの堅牢性を検証・向上させるための再現可能でオープンソースのツールを提供すること。

提案手法

  • MalRNNは、生のマルウェアバイナリデータから直接、バイトレベルの言語モデルを学習するためのシーケンス・ツー・シーケンスRNNを採用する。
  • モデルは、元のマルウェアバイナリに付加可能な、悪意のない見た目のバイナリシーケンスを生成するように訓練される。
  • 攻撃は完全にブラックボックスである。ターゲット検出器のアーキテクチャ、パラメータ、信頼度スコアへのアクセスは不要である。
  • この手法は、RNNの生成的機能を活用し、機能を保持しつつ検出を回避する摂動を生成する。
  • MalRNNは、8つのマルウェアカテゴリを含む実世界のデータセットを用いて評価され、3つの最先端のDLベースの検出器における検出率を用いて回避成功率が測定された。
  • 動的解析を回避するため、静的バイナリ表現とシーケンスモデリングに完全に依存している。

実験結果

リサーチクエスチョン

  • RQ1ターゲットモデルの内部パrameter や信頼度スコアへのアクセスが一切ない状況下でも、深層生成モデルが効果的な敵対的バイトシーケンスを生成し、マルウェア回避に成功するか?
  • RQ2シーケンス・ツー・シーケンスRNNベースの言語モデルは、多様なマルウェアファミリーにわたり、効果的に回避可能なマルウェア変種を生成できるか?
  • RQ3ランサムウェア、バックドア、ドロッパーなどの異なるマルウェアタイプは、ブラックボックスの付加型敵対的攻撃に対して、それぞれどの程度脆弱であるか?
  • RQ4最小限の追加バイト数(低摂動コスト)で、既存のベンチマーク手法を上回る回避率を達成できるか?
  • RQ5再トレーニングなしに、複数のディープラーニングベースのマルウェア検出器に一般化できるか?

主な発見

  • MalRNNは、モデル固有の情報が一切不要な状況下でも、全8つのマルウェアカテゴリにおいて3つの最先端のDLベースのマルウェア検出器を効果的に回避した。
  • 最高の回避率はバックドアマルウェアで54.28%を記録し、その高率な回避は、悪意のないコードに類似したコード割合の高さに起因すると考えられる。
  • ランサムウェアとボットネットマルウェアは、それぞれ29.33%および23.57%の最低の回避率を示し、明確な悪意あるコード構造がディープラーニングモデルによって容易に検出可能であるためと推察される。
  • MalRNNは、ヒューリスティック法やブルートフォース法に比べ、生成的アプローチの優位性を示し、回避効果において既存のベンチマーク手法を上回った。
  • 最小限の摂動で高い回避率を達成しており、生成されたバイトシーケンスが効果的かつ隠れやすいことが示された。
  • 結果から、ディープラーニングベースのマルウェア検出器が、モデル内部情報や信頼度スコアへのアクセスが一切ないブラックボックス攻撃に対しても脆弱であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。