[論文レビュー] Adversarial Attacks on Transformers-Based Malware Detectors
この論文は、Fast Gradient Sign Method (FGSM) を用いて摂動を加えたマルウェアサンプルを生成することで、Transformerベースのマルウェア検出器における悪意ある脆弱性を調査し、23.9% の誤分類率を達成した。悪意ある攻撃に対する防御策として、 adversarial training と特徴空間の低減を提案し、誤分類率をそれぞれ 11.2% および 21.5% に低下させ、最先端のモデルが回避攻撃に対して脆弱であることを示した。
Signature-based malware detectors have proven to be insufficient as even a small change in malignant executable code can bypass these signature-based detectors. Many machine learning-based models have been proposed to efficiently detect a wide variety of malware. Many of these models are found to be susceptible to adversarial attacks - attacks that work by generating intentionally designed inputs that can force these models to misclassify. Our work aims to explore vulnerabilities in the current state of the art malware detectors to adversarial attacks. We train a Transformers-based malware detector, carry out adversarial attacks resulting in a misclassification rate of 23.9% and propose defenses that reduce this misclassification rate to half. An implementation of our work can be found at https://github.com/yashjakhotiya/Adversarial-Attacks-On-Transformers.
研究の動機と目的
- 最先端のTransformerベースのマルウェア検出器が悪意ある攻撃に対してどれほど脆弱であるかを評価すること。
- マルウェア検出システムにおける回避攻撃に対して、さまざまな防御手法の有効性を評価すること。
- Transformerのような高度なディープラーニングモデルですら、マルウェアバイナリの小さな標的の摂動に対して脆弱であることを実証すること。
- マルウェア検出モデルにおける悪意ある攻撃および防御の実用的実装を提供すること。
提案手法
- PEファイルから抽出したアセンブリコードと静的特徴量を用いて、Transformerベースのマルウェア検出器を訓練した。
- Fast Gradient Sign Method (FGSM) を用いて、入力特徴量に小さな標的の摂動を加えることで、悪意あるサンプルを生成した。
- 誤分類確率を最大化するために、ターゲットクラスラベルを用いた標的型FGSMを適用した。
- 悪意あるサンプルを再訓練データとして用いることで、モデルの耐性を向上させる adversarial training を実装した。
- 摂動の可能な次元数を制限するために、特徴空間を低減した。
- 悪意ある入力に対する誤分類率を測定することで、防御の性能を評価した。
実験結果
リサーチクエスチョン
- RQ1悪意ある攻撃は、最先端のTransformerベースのマルウェア検出器を効果的に回避できるか?
- RQ2FGSMは、検出を回避する悪意あるマルウェアサンプルを生成するのにどの程度有効か?
- RQ3adversarial training と特徴空間の低減といった、異なる防御戦略はモデルの耐性にどのように影響するか?
- RQ4特徴空間の低減は、悪意ある攻撃をどの程度軽減できるか?
主な発見
- FGSMを用いた悪意ある攻撃により、Transformerベースのマルウェア検出器で23.9% の誤分類率が達成された。
- adversarial training により、誤分類率は11.2% に低下し、耐性の著しい向上が確認された。
- 特徴空間の低減は耐性をわずかに向上させ、誤分類率を21.5% に低下させた。
- 結果から、Transformerのような高度なディープラーニングモデルでさえ、小さな入力摂動による回避攻撃に対して脆弱であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。