Skip to main content
QUICK REVIEW

[論文レビュー] Defending Malware Classification Networks Against Adversarial Perturbations with Non-Negative Weight Restrictions

Alex Kouzemtchenko|arXiv (Cornell University)|Jun 23, 2018
Adversarial Robustness in Machine Learning参考文献 6被引用数 4
ひとこと要約

本論文では、Androidマルウェアにおけるブール特徴の操作を防ぐために、非負の重み制約を用いたマルウェア分類ニューラルネットワークの訓練を提案する。ハードな非負の重みまたはN1/N2正則化を適用することで、分類器をだます特徴を操作する勾配ベースの攻撃に対して完全に耐性を持つモデルが得られ、ハード制約では0%の誤分類率を達成し、防御 distillation を含むベースライン手法を上回る性能を発揮する。

ABSTRACT

There is a growing body of literature showing that deep neural networks are vulnerable to adversarial input modification. Recently this work has been extended from image classification to malware classification over boolean features. In this paper we present several new methods for training restricted networks in this specific domain that are highly effective at preventing adversarial perturbations. We start with a fully adversarially resistant neural network that has hard non-negative weight restrictions and is equivalent to learning a monotonic boolean function and then attempt to relax the constraints to improve classifier accuracy.

研究の動機と目的

  • ブール特徴の操作によって悪意あるソフトウェアが良性と誤分類されるという、深層ニューラルネットワークのマルウェア分類における脆弱性を解消すること。
  • 非負の重み制約が、勾配ベースの悪意ある攻撃に対してマルウェア分類器を完全に耐性を持たせられることを検証すること。
  • 正則化手法によるハード制約の緩和を通じて、悪意ある攻撃に対する耐性と分類精度のトレードオフを評価すること。
  • 防御 distillation や他の既存防御手法と比較して、非負の重み制約の有効性を評価すること。特に、勾配マスキングに依存する真の耐性ではなく、本質的な耐性であるかを検証すること。

提案手法

  • DREBINデータセットを用いて、ReLU活性化関数と50%ドロップアウトを適用した全結合深層ニューラルネットワークを、ブール特徴学習における単調性を強制するためのハードな非負の重み制約を用いて訓練する。
  • 非負の重み値に対してのみL1およびL2ノルムを適用するN1およびN2正則化ペナルティを実装する。
  • 重み値そのものではなく、活性化値の前処理値や活性化値自体にペナルティを適用することで、正則化の配置を変更し、小さな負の重みが大きな負の寄与をもたらすのを防ぐ。
  • 収束の加速と学習安定性の向上を図るため、非負の重み初期化(Glorot正規分布の絶対値)を採用する。
  • Grosseらの悪意ある攻撃手法を再現し、マニフェストベースのバイナリ特徴のみを有効化して分類器をだます勾配ベースの特徴選択を実施する。
  • 誤分類率(MR)、偽陰性率(FNR)、偽陽性率(FPR)などの指標を用いて、ハード制約、正則化、およびdistillationの防御手法を比較評価する。

実験結果

リサーチクエスチョン

  • RQ1ハードな非負の重み制約は、ブール特徴に基づいて学習されたマルウェア分類ネットワークに対して、悪意ある摂動を完全に防止できるか?
  • RQ2N1/N2正則化は、ハード制約と比較して、分類精度を維持しつつ耐性を向上させる程度はどの程度か?
  • RQ3重み正則化とは異なり、活性化値または前処理活性化値に正則化ペナルティを適用することで、悪意ある攻撃に対する耐性が向上するか?
  • RQ4防御 distillation は非負の重み制約と比較して、悪意ある攻撃に対する耐性をどのように発揮するか。その成功は真の耐性に起因するのか、それとも勾配マスキングによるものか?
  • RQ5非負の重み制約により、非単調なブールルールを学習できないにもかかわらず、依然として高い分類精度を達成できるか?

主な発見

  • ハードな非負の重み制約ネットワークは、0%の誤分類率、6.29%のFNR、0.75%のFPRを達成し、distillationを含むすべての他の手法を上回った。
  • N1正則化(0.67)モデルは、ハード制限ネットワークより性能が劣り、誤分類率18.86%、FNR11.15%、FPR1.71%を示した。これはソフト正則化が効果的でないことを示唆している。
  • N2正則化は、悪意ある攻撃に対する耐性向上に有意義な改善をもたらさず、負の重みに対するL2ペナルティが耐性を確保するには不十分であることを示した。
  • 活性化値や前処理活性化値に正則化を適用する代替配置も、性能向上をもたらさなかった。これは、根本的な原因が重み値そのものにあることを示唆している。
  • 高温(例:100)での防御 distillation は、誤分類率が低かった(3.4%)が、95.3%の悪意ある例が微調整されたモデルでも依然として誤分類されたことから、勾配マスキングに依存していることが判明した。
  • ハード制限ネットワークは、単調なブール関数を学習していると同等であり、今後の研究において単調性を活用した耐性のあるマルウェア検出の可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。