Skip to main content
QUICK REVIEW

[論文レビュー] On the Limitation of MagNet Defense against $L_1$-based Adversarial Examples

Pei-Hsuan Lu, Pin‐Yu Chen|arXiv (Cornell University)|Apr 14, 2018
Adversarial Robustness in Machine Learning参考文献 19被引用数 11
ひとこと要約

この論文は、自己符号化器を用いた敵対的検出器とデータ再構成器を組み合わせた防御手法であるMagNetが、Elastic-Net攻撃(EAD)によって生成された$L_1$ベースの敵対的例に対して効果を示さないことを示している。Carlini & Wagnerの$L_2$ベース攻撃に対しては優れた性能を示すが、$L_1$ベースの摂動は検出されず、再構成されず、MNISTおよびCIFAR-10の標準設定下で攻撃成功率が90%を超える。これは、設計上に深刻な脆弱性が存在することを示している。

ABSTRACT

In recent years, defending adversarial perturbations to natural examples in order to build robust machine learning models trained by deep neural networks (DNNs) has become an emerging research field in the conjunction of deep learning and security. In particular, MagNet consisting of an adversary detector and a data reformer is by far one of the strongest defenses in the black-box oblivious attack setting, where the attacker aims to craft transferable adversarial examples from an undefended DNN model to bypass an unknown defense module deployed on the same DNN model. Under this setting, MagNet can successfully defend a variety of attacks in DNNs, including the high-confidence adversarial examples generated by the Carlini and Wagner's attack based on the $L_2$ distortion metric. However, in this paper, under the same attack setting we show that adversarial examples crafted based on the $L_1$ distortion metric can easily bypass MagNet and mislead the target DNN image classifiers on MNIST and CIFAR-10. We also provide explanations on why the considered approach can yield adversarial examples with superior attack performance and conduct extensive experiments on variants of MagNet to verify its lack of robustness to $L_1$ distortion based attacks. Notably, our results substantially weaken the assumption of effective threat models on MagNet that require knowing the deployed defense technique when attacking DNNs (i.e., the gray-box attack setting).

研究の動機と目的

  • ブラックボックスの無知攻撃設定下で、MagNetの$L_1$ベースの敵対的例に対する耐性を評価すること。
  • $L_1$ベース攻撃(例:EAD)がなぜMagNetの防御モジュールを回避できるかを解明すること。
  • 自己符号化器の構造や再構成損失関数といったアーキテクチャ的選択が、MagNetの防御能力に与える影響を評価すること。
  • 攻撃者が防御を把握している場合にMagNetが堅牢であるという仮定を覆し、$L_1$攻撃が防御の知識がなくても成功することを示すこと。
  • $L_1$ベースの摂動がMagNetの検出器および再構成器の構造的弱みを突くという、実証的かつ分析的証拠を提供すること。

提案手法

  • 著者らは、MNISTおよびCIFAR-10データセット上で、$L_1$および$L_2$のハイブリッド摂動を持つElastic-Net攻撃(EAD)を用いて敵対的例を生成した。
  • EADは、非重要ピクセルへの摂動を最小化するためのスパarsity誘導型$L_1$ペナルティを組み合わせた、$L_1$および$L_2$の歪み指標を用いる。
  • MagNetの防御は、デフォルト設定および強化されたバージョン(256フィルタを備えた変更済み自己符号化器、平均絶対誤差(MAE)再構成損失)を用いて評価された。
  • 攻撃の信頼度レベル($\beta$)を変化させながら、攻撃成功率(ASR)および分類精度を用いて防御性能を測定した。
  • EADの性能は、$L_1$/$L_2$再構成誤差およびJSD発散に基づくMagNetの検出器、および自己符号化器ベースの画像再構成による再構成器と比較された。
  • MNISTおよびCIFAR-10の両方で広範な実験が行われ、検出器タイプ、再構成損失関数、ネットワークの深さに関するアブレーションスタディが実施された。

実験結果

リサーチクエスチョン

  • RQ1EADによって生成された$L_1$ベースの敵対的例は、ブラックボックスの無知攻撃設定下で、MagNetの検出器および再構成器モジュールを効果的に回避できるか?
  • RQ2なぜEADはCarlini & Wagnerの$L_2$ベース攻撃よりも、MagNetの防御機構を回避する能力に優れているのか?
  • RQ3自己符号化器の深さや再構成損失関数といった、MagNetのアーキテクチャ的選択が、$L_1$ベース攻撃に対する耐性に与える影響は何か?
  • RQ4自己符号化器の学習に平均絶対誤差(MAE)を使用することで、$L_1$ベースの敵対的例に対するMagNetの耐性は向上するか?
  • RQ5攻撃者が防御機構を把握していない場合(無知攻撃モデルの仮定に従う場合)、MagNetの防御はどの程度失敗するのか?

主な発見

  • MNISTでは、$\beta = 10^{-1}$の下で、$L_1$ルールを用いたデフォルトMagNetに対するEADの攻撃成功率(ASR)は90.2%に達し、防御のほぼ完全な失敗を示している。
  • CIFAR-10では、デフォルトMagNetに対して78.6%、強化版(D+256)に対しては91.5%のASRを記録しており、強化されたMagNetですら$L_1$攻撃に対して脆弱であることが示された。
  • 自己符号化器の学習に平均絶対誤差(MAE)を使用しても、$L_2$攻撃に対する防御は向上するが、$L_1$ベースのEAD攻撃に対しては効果がなく、依然として70%を超えるASRを記録した。
  • MagNetの$L_1$再構成誤差に基づく検出器は、$L_1$ベースの敵対的例を検出できず、低信頼度レベル($\beta = 10^{-3}$)でも高いASRが観測された。
  • 温度$T=40$を用いたJSDベースの検出器は検出性能を向上させたが、依然としてCIFAR-10で60%を超えるASRをEADが達成しており、防御の限界が明確に示された。
  • 256フィルタを備えた自己符号化器であっても、MagNetのEAD攻撃に対する防御能力は弱く、$\beta = 10^{-1}$でASRが93.7%にまで上昇した。これは、アーキテクチャのスケーリングでは$L_1$の脆弱性が解消されないことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。