Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Malware Binaries: Evading Deep Learning for Malware Detection in Executables

Bojan Kolosnjaji, Ambra Demontis|arXiv (Cornell University)|Mar 12, 2018
Advanced Malware Detection Techniques被引用数 4
ひとこと要約

この論文は、マルウェアバイナリの1%未塔のバイトを変更することで、深層学習ベースのマルウェア検出器を回避する勾配ベースの敵対的攻撃を提案している。具体的には、ポータブル実行可能(PE)ファイルの末尾に最適化されたパディングバイトを挿入する。この手法は、MalConvに対して60%の回避率を達成し、生バイトモデルが微細で機能を保つ摂動に対して極めて脆弱であることを示している。

ABSTRACT

Machine-learning methods have already been exploited as useful tools for detecting malicious executable files. They leverage data retrieved from malware samples, such as header fields, instruction sequences, or even raw bytes, to learn models that discriminate between benign and malicious software. However, it has also been shown that machine learning and deep neural networks can be fooled by evasion attacks (also referred to as adversarial examples), i.e., small changes to the input data that cause misclassification at test time. In this work, we investigate the vulnerability of malware detection methods that use deep networks to learn from raw bytes. We propose a gradient-based attack that is capable of evading a recently-proposed deep network suited to this purpose by only changing few specific bytes at the end of each malware sample, while preserving its intrusive functionality. Promising results show that our adversarial malware binaries evade the targeted network with high probability, even though less than 1% of their bytes are modified.

研究の動機と目的

  • 生バイトで学習された深層学習モデルがマルウェア検出に対して敵対的攻撃に対してどれほど脆弱であるかを調査すること。
  • 検出を回避できる、実用的で機能を保つ敵対的マルウェアバイナリを生成する方法を開発すること。
  • 勾配ベースの最適化が、誤検出確率を最大化するバイトレベルの摂動を効果的に生成できるかを評価すること。
  • MalConvを回避する際、勾配ベースの攻撃とランダムバイト挿入の有効性を比較すること。
  • 生バイト解析の限界を強調し、より強固な検出手法の導入を提唱すること。

提案手法

  • 攻撃は、入力バイトに対して勾配上昇を用い、マルウェアサンプルが良性と予測される確率を最大化する。
  • 攻撃は、マルウェアの機能的整合性を保つために、PEファイルの末尾に追加されたパディングバイトに限定する。
  • 損失関数の入力バイトに関する勾配を計算し、反復的にパディングバイトを更新することで、誤分類を最大化する。
  • 攻撃は、PEファイルの生バイトを学習対象とした深層ニューラルネットワークであるMalConvに適用される。
  • 攻撃の評価は、各マルウェアサンプルに10,000個の最適化済みバイトを挿入し、回避率を測定することで行われる。
  • 比較のためのベースラインとしてランダムバイト挿入攻撃が用いられ、勾配ベース手法の優位性を示している。

実験結果

リサーチクエスチョン

  • RQ1PEファイル内の生バイトシーケンスで学習された深層学習モデルは、バイナリの小さな機能を保つ変更によって回避可能か?
  • RQ2MalConvを回避するための敵対的パディングバイトを生成する勾配ベースの最適化戦略はどの程度有効か?
  • RQ3勾配ベース攻撃は、マルウェア検出を回避するうえで、ランダムバイト挿入を著しく上回るか?
  • RQ4ファイル内の初期バイトと後期バイトを変更した場合、攻撃の成功にどのような影響を与えるか?
  • RQ5多様なマルウェアサンプルに一般化可能であり、機能を保ったままか?

主な発見

  • 勾配ベース攻撃は、10,000個の最適化済みパディングバイトを挿入した場合、MalConvに対して60%の回避率を達成した。これは入力ファイルサイズの1%未塔に相当する。
  • 攻撃はランダムバイト挿入を著しく上回り、モデルの回避にほとんど効果がなかった。
  • 勾配ベース攻撃における挿入バイトの分布は一貫した非ランダムなパターンを示しており、モデルの勾配に従った標的的な操作であることが示された。
  • 勾配ノルムはファイルの先頭に近いバイトで著しく高くなっており、初期バイトを変更すると回避成功率が高まる可能性があるが、機能への影響リスクも高くなる。
  • 結果から、生バイトに基づく深層学習モデルは、非侵入的領域(例:ファイルパディング)に制限された摂動であっても、敵対的例に対して脆弱であることが示された。
  • 本研究は、敵対的操作を考慮し、バイナリフォーマットの構造的知識を統合するより強固な検出手法の必要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。