[論文レビュー] MERLIN -- Malware Evasion with Reinforcement LearnINg
本稿では、DQNおよびREINFORCEを用いた強化学習ベースのフレームワークMERLINを提案する。このフレームワークは、Windows PEファイルに対する意味論的保存的変更を用いて、機械学習ベースのマルウェア検出機器(MalConv、EMBER)および商用AVを回避する。REINFORCEは、最先端のモデルで75%を超える回避率を達成し、商用AVに対しても顕著な成功を収める。また、防御強化を支援するための詳細な脆弱性レポートを生成する。
In addition to signature-based and heuristics-based detection techniques, machine learning (ML) is widely used to generalize to new, never-before-seen malicious software (malware). However, it has been demonstrated that ML models can be fooled by tricking the classifier into returning the incorrect label. These studies, for instance, usually rely on a prediction score that is fragile to gradient-based attacks. In the context of a more realistic situation where an attacker has very little information about the outputs of a malware detection engine, modest evasion rates are achieved. In this paper, we propose a method using reinforcement learning with DQN and REINFORCE algorithms to challenge two state-of-the-art ML-based detection engines (MalConv \& EMBER) and a commercial AV classified by Gartner as a leader AV. Our method combines several actions, modifying a Windows portable execution (PE) file without breaking its functionalities. Our method also identifies which actions perform better and compiles a detailed vulnerability report to help mitigate the evasion. We demonstrate that REINFORCE achieves very good evasion rates even on a commercial AV with limited available information.
研究の動機と目的
- 最小限の事前知識で、現代の機械学習ベースおよび商用のアンチウイルスマルウェア検出システムを自動的にブラックボックスで回避する手法を開発すること。
- 検出を回避しつつも悪意ある動作を維持する機能的保存的変更を同定・分析すること。
- 回避成功の理由を説明し、検出エンジンの強化を支援するための実行可能な脆弱性レポートを生成すること。
- 低情報・ブラックボックス環境下での、強化学習アルゴリズム(DQN 対 REINFORCE)の有効性を評価すること。
- 体系的な敵対的テストと説明可能な回避パターンを通じて、検出エンジンの構造的弱みを解明すること。
提案手法
- 検出APIが良性/悪性のラベルのみを返すブラックボックスなシナリオを模倣するカスタム環境を用いた強化学習フレームワークを採用する。
- DQNおよびREINFORCEアルゴリズムを用い、モデルの勾配や内部スコアを必要とせずに、PEファイルに対するバイナリ変更アクションの最適なシーケンスを学習する。
- 機械的タイプの変更、良性ライブラリの追加、タイムスタンプの変更、良性ファイルからの文字列挿入など、意味論的保存的アクションを適用する。
- 変更後のバイナリが元の悪意ある動作を保持していることを検証することで、機能的同等性を維持する。
- すべてのアクション、その影響、および回避成功への寄与度を追跡する詳細な脆弱性レポートを生成する。
- 攻撃プロセスの進化とアクションの有効性を可視化し、解釈可能性と防御分析を支援する。
実験結果
リサーチクエスチョン
- RQ1強化学習は、良性/悪性のラベルのみが入手可能なブラックボックス環境下で、最先端の機械学習ベースのマルウェア検出機器(MalConv、EMBER)および商用AVを効果的に回避するための敵対的PEファイルを生成できるか?
- RQ2硬いラベル(良性/悪性)のみが利用可能な状況下で、DQNとREINFORCEの回避成功率および耐性性能はどのように比較されるか?
- RQ3どの具体的なバイナリ変更アクションが回避に最も効果的であり、検出を回避するためにどのように寄与しているか?
- RQ4生成された脆弱性レポートは、検出エンジンの耐性強化のための実行可能なインサイトを提供できるか?
- RQ5アクションの順序は回避にどの程度影響を与えるか?また、REINFORCEがシーケンスをモデル化できる能力が、DQNの個々のアクションへの集中に比べてどのように優れているか?
主な発見
- REINFORCEはMalConvおよびEMBERで75%を超える回避率を達成し、低情報ブラックボックス環境下でも優れた性能を示している。
- 商用AVでは限られた情報の中でもREINFORCEは顕著な回避成功を収め、DQNを上回り、場合によってはランダムサーチをも凌駆する。
- DQNは、アクションのシーケンスを効果的にモデル化できないため、商用AVでは性能が劣り、最終アクションの結果に依存している。
- 「機械的タイプの変更」は、成功した回避シーケンスで頻繁に使用されており、検出エンジンにおける重要な脆弱性である可能性がある。
- 脆弱性レポートは、どの変更が回避に寄与したかを詳細かつ解釈可能な形で提供し、標的的な防御強化を可能にする。
- このフレームワークは、機能的かつ検出されないマルウェアバージョンを効果的に生成でき、将来的に検出モデルの再訓練を通じた耐性強化に利用可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。