[論文レビュー] Generic Black-Box End-to-End Attack Against State of the Art API Call Based Malware Classifiers
本稿では、機能を変更せずに、APIコールシーケンスおよび静的特徴(例:印刷可能文字列)を摂動させることで、最新の機械学習マルウェア分類器を回避する汎用ブラックボックス攻撃を提示する。攻撃はRNN、DNN、SVMなどの従来の分類器を横断的に高い転送性を示し、ハイブリッドモデルでは82.27%の効果を示す。GADGETフレームワークを用いて、ソースコードのアクセスなしにエンドツーエンドで回避可能である。
In this paper, we present a black-box attack against API call based machine learning malware classifiers, focusing on generating adversarial sequences combining API calls and static features (e.g., printable strings) that will be misclassified by the classifier without affecting the malware functionality. We show that this attack is effective against many classifiers due to the transferability principle between RNN variants, feed forward DNNs, and traditional machine learning classifiers such as SVM. We also implement GADGET, a software framework to convert any malware binary to a binary undetected by malware classifiers, using the proposed attack, without access to the malware source code.
研究の動機と目的
- 最新のAPIコールベースのマルウェア分類器を、ソースコードのアクセスなしに、実用的でエンドツーエンドのブラックボックス攻撃によって回避する。
- RNN、DNN、SVMやランダムフォレストなどの従来の機械学習モデルを含む、多様な分類器アーキテクチャにわたる、アドバーシャル例の転送性を実証する。
- 動的(APIシーケンス)および静的(例:文字列)特徴を組み合わせたマルチ特徴分類器に攻撃を拡張し、実世界の検出システムを反映する。
- 50万個のマルウェアおよび良性サンプルを含む大規模データセットを用いて、複数の分類器タイプにわたる攻撃の有効性を検証する。
- GADGETを実装し、任意の入力から機能的に完全なアドバーシャルマルウェアバイナリを自動生成・評価する。
提案手法
- 攻撃は、データセットの代表的サブセット上で訓練されたサーロー・モデルを用い、勾配ベースの最適化により、アドバーシャル摂動を生成する。APIコールシーケンスと印刷可能文字列を変更する。
- APIシーケンス攻撃では、意味的整合性とマルウェアの機能を保持しつつ、ワンホットエンコードされたAPIシーケンスに勾配ベースの摂動を適用する。
- 静的特徴攻撃では、サーロー・モデルの勾配推定値を用いて文字列を選択し、バイナリに追加する。これにより、最終的なサンプルが悪意あるままかつ検出されない状態を保つ。
- 統合攻撃では、動的および静的特徴を同時に変更し、ハイブリッド分類器をターゲットとし、元のモデルでの回避を検証する。
- GADGETは攻撃パイプラインを統合し、IATパッチや新規セクションを用いて、バイナリに変更された特徴(例:文字列)を挿入する。実行に支障をきたさない。
- 本手法は、転送性の原則に依存している:サーロー・モデルに対して作成されたアドバーシャル例は、ターゲットのブラックボックス分類器を効果的に回避する。
実験結果
リサーチクエスチョン
- RQ1ブラックボックスアドバーシャル攻撃は、RNN、DNN、SVMやランダムフォレストなどの多様なアーキテクチャを含む、最新のAPIコールベースのマルウェア分類器を効果的に回避できるか?
- RQ2ハイブリッド分類器に静的特徴(例:印刷可能文字列)を組み込むことで、標的アドバーシャル攻撃の有効性はどの程度軽減されるか?
- RQ3ソースコードのアクセスなしに、実際のマルウェアバイナリに対してエンドツーエンドでアドバーシャル摂動を生成できるか、かつ機能を保持できるか?
- RQ4動的および静的特徴を組み合わせたマルチ特徴分類器に適用した場合、攻撃の有効性はどの程度か?(実世界のシステムで使用されるものと同一)
- RQ5マルウェア検出の文脈において、サーロー・モデルから実際の分類器へのアドバーシャル例の転送性は、RNNの異なるバリアントおよび非RNNアーキテクチャにおいても妥当かつ一貫しているか?
主な発見
- 動的特徴(APIシーケンス)のみで訓練された分類器に対して、96.03%の有効性を達成し、専用モデルでも高い成功を示した。
- 動的および静的特徴を組み合わせたハイブリッド分類器を標的とした場合、82.27%の有効性を維持した。マルチ特徴防御に対しても耐性があることを示した。
- 文字列のみの攻撃では、ハイブリッドモデルで68.66%の有効性を示したが、静的特徴のみの分類器では77.33%であった。これにより、ハイブリッドモデルが部分的に防御効果を発揮していることが示唆された。
- LSTM、GRU、フィードフォワードDNN、1D CNN、SVM、ランダムフォレスト、ロジスティック回帰、GBDTなど、多様な分類器タイプで攻撃が有効であった。広範な転送性が確認された。
- GADGETフレームワークは、ソースコードのアクセスなしに、バイナリに変更された特徴を挿入することで、機能的に完全なアドバーシャルバイナリを効果的に生成した。エンドツーエンドの実現可能性が裏付けられた。
- サイバーセキュリティ分野において、本研究は、サーロー・モデルに対して作成されたアドバーシャル例が、実世界のブラックボックスマルウェア分類器を高信頼性で回避できることを、初めて実証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。