Skip to main content
QUICK REVIEW

[論文レビュー] Creating Valid Adversarial Examples of Malware

Matouš Kozák, Martin Jureček|arXiv (Cornell University)|Jun 23, 2023
Advanced Malware Detection TechniquesComputer Science被引用数 3
ひとこと要約

本論文は、ポータブル実行可能ファイル(PE)の変更を用いて、実行可能で機能を保ったバイナリレベルの悪意あるマルウェア例を強化学習に基づいて生成するフレームワークを提案する。プロキシマルポリシー最適化(PPO)を用いた手法は、勾配ブースティング決定木分類器に対して53.84%の回避率を達成し、MalConvに対しては11.41%を達成した。同様の変更をランダムに適用した場合、上位のアンチウイルスエンジンの平均で11.65%が回避された。

ABSTRACT

Machine learning is becoming increasingly popular as a go-to approach for many tasks due to its world-class results. As a result, antivirus developers are incorporating machine learning models into their products. While these models improve malware detection capabilities, they also carry the disadvantage of being susceptible to adversarial attacks. Although this vulnerability has been demonstrated for many models in white-box settings, a black-box attack is more applicable in practice for the domain of malware detection. We present a generator of adversarial malware examples using reinforcement learning algorithms. The reinforcement learning agents utilize a set of functionality-preserving modifications, thus creating valid adversarial examples. Using the proximal policy optimization (PPO) algorithm, we achieved an evasion rate of 53.84% against the gradient-boosted decision tree (GBDT) model. The PPO agent previously trained against the GBDT classifier scored an evasion rate of 11.41% against the neural network-based classifier MalConv and an average evasion rate of 2.31% against top antivirus programs. Furthermore, we discovered that random application of our functionality-preserving portable executable modifications successfully evades leading antivirus engines, with an average evasion rate of 11.65%. These findings indicate that machine learning-based models used in malware detection systems are vulnerable to adversarial attacks and that better safeguards need to be taken to protect these systems.

研究の動機と目的

  • 機械学習ベースのマルウェア検出器を回避できるブラックボックスの悪意ある攻撃フレームワークを開発すること。
  • 妥当なバイナリ変更を通じて、生成された悪意ある例が元のマルウェアの機能を保持することを保証すること。
  • 悪意ある例の異なる分類器、特に実世界のアンチウイルスエンジンへの転送可能性を評価すること。
  • 訓練された強化学習エージェントと同様の変更をランダムに適用する戦略の回避性能を比較すること。

提案手法

  • 強化学習エージェントをPEバイナリファイル上で訓練できるように、カスタムのOpenAI Gym互換環境を設計した。
  • 実行を損なわずにバイナリを変更する12種類の機能を保つPE変更(例:NOP挿入、セクションヘッダの変更)を実装した。
  • 報酬関数を最大化し、ファイルサイズの増加を最小限に抑えるために、ハイパーパrameter γ=0.5 および α=0.0001 を用いたプロキシマルポリシー最適化(PPO)を用いてエージェントを訓練した。
  • システムレベルの挙動を変更前後で比較する行動比較法を用いて、機能の保持を検証した。
  • 7,000個のWindowsマルウェアEXEからなるデータセットを用い、GBDT、MalConv、および上位の商用AVに対する回避をテストした。
  • 訓練済みのPPOエージェントと、同様の変更をランダムに適用するエージェント、およびベースラインとしてMAB-Malwareフレームワークを比較した。

実験結果

リサーチクエスチョン

  • RQ1強化学習エージェントは、ブラックボックス環境下で、有効で機能的な悪意あるマルウェア例を生成し、機械学習ベースのマルウェア検出器を回避できるか?
  • RQ2PPOベースのエージェントは、ランダムな変更戦略と比較して、勾配ブースティング決定木(GBDT)分類器を回避する上でどの程度効果的か?
  • RQ3サーヴィレートモデル(GBDT)に対して生成された悪意ある例の、実世界のアンチウイルスエンジンへの転送可能性はいかがなっているか?
  • RQ4同様の機能を保つ変更をランダムに適用する方法が、商用AVを回避する上で訓練済みのRLエージェントを上回るか?
  • RQ5本手法は、MAB-Malwareのような既存のフレームワークと比較して、有効性および回避性能の面でどの程度優れているか?

主な発見

  • PPOエージェントはGBDT分類器に対して53.84%の回避率を達成し、平均してファイルサイズが3.57%増加した。
  • PPOエージェントはニューラルネットワークベースのMalConv分類器に対して11.41%の回避率を達成した。
  • PPOエージェントは上位の商用アンチウイルスエンジンに対して平均2.31%の回避率を達成した。
  • 同様の変更をランダムに適用するエージェントは、上位のAVに対して平均11.65%の回避率を達成し、PPOエージェントおよびMAB-Malwareを上回った。
  • MAB-Malwareフレームワークは、GBDT(76.12%の回避率)およびMalConv(60.1%の回避率)でPPOおよびランダムエージェントを上回ったが、AVでは平均2.61%の回避率にとどまった。
  • 本研究では、実世界のAVに対して効果的な回避をもたらさないため、GBDTをサーヴィレートモデルとして悪意ある例を生成する手法には、より優れたサーヴィレートモデルの必要性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。