Skip to main content
QUICK REVIEW

[論文レビュー] Thwarting Adversarial Examples: An $L_0$-RobustSparse Fourier Transform

Mitali Bafna, Jack Murtagh|arXiv (Cornell University)|Dec 12, 2018
Adversarial Robustness in Machine Learning被引用数 7
ひとこと要約

この論文は、最悪の $L_0$ ノイズ(任意に破損した座標が有限個)によって汚染された近似的にスパースな信号を回復する $L_0$-ロバストなスパースフーリエ変換を導入する。圧縮センシング理論を活用することで、敵対的摂動からの綺麗な画像の復元が保証され、MNIST、Fashion-MNIST、ImageNet において、JSMA や CW、敵対的パッチなどの強い $L_0$ 攻撃に対して、ニューラルネットワークの精度を 0% から 85% を超える水準まで回復可能である。

ABSTRACT

We give a new algorithm for approximating the Discrete Fourier transform of an approximately sparse signal that has been corrupted by worst-case $L_0$ noise, namely a bounded number of coordinates of the signal have been corrupted arbitrarily. Our techniques generalize to a wide range of linear transformations that are used in data analysis such as the Discrete Cosine and Sine transforms, the Hadamard transform, and their high-dimensional analogs. We use our algorithm to successfully defend against well known $L_0$ adversaries in the setting of image classification. We give experimental results on the Jacobian-based Saliency Map Attack (JSMA) and the Carlini Wagner (CW) $L_0$ attack on the MNIST and Fashion-MNIST datasets as well as the Adversarial Patch on the ImageNet dataset.

研究の動機と目的

  • 入力座標の有限個が任意に破損する可能性のある $L_0$ 敵対的攻撃に対して汎用的な防御フレームワークを構築すること。
  • スパース回復技術を圧縮センシング理論に基づいて用いることで、最悪の $L_0$ ノイズ下での信号回復に理論的保証を提供すること。
  • DFT、DCT、DST、ハダマード変換を含む広範な線形変換クラスにこの防御を拡張し、信号処理およびコンピュータビジョン分野への広範な応用可能性を実現すること。
  • 提案された変換による画像回復が、深刻な $L_0$ 攻撃後でさえ分類器の精度を回復できることを実証すること。攻撃戦略の事前知識がなくても可能である。
  • 連続的かつスパースなフーリエドメインに現れる実世界の $L_0$ 誘発要因(例:敵対的パッチ、物理的遮蔽)に対処できること。

提案手法

  • 反復的ハードスレッディング(IHT)に基づく新しい $L_0$-ロバストなスパースフーリエ変換を提案。フーリエ基底と標準基底の両方で、交互にスパース信号とノイズを推定する。
  • IHT アルゴリズムを用いて、$t$-スパースな $L_0$ ノイズで汚染された信号の上位 $k$ 個のフーリエ係数を、固定回数の反復 $T$ を用いて回復する。
  • 連続的ノイズ(例:敵対的パッチ)の場合は、画像の $\ell \times \ell$ パッチをブロック単位で探索する Patchwise IHT を導入。残差のフーリエドメインにおけるスパarsity を最小化することで、ノイズを同定・修正する。
  • 自然画像が DCT や DFT のドメインで近似的にスパースであるという事実を活用し、フーリエ基底をスパarsityドメインとして用いる。これにより、効果的な圧縮と回復が可能になる。
  • 2段階の反復プロセスを採用:(1) フーリエドメインで上位 $k$ 個の係数に対するハードスレッディングにより信号を推定、(2) 残差の上位 $t$ 個の成分に対するハードスレッディングにより標準基底でノイズを推定。
  • 理論的基盤は圧縮センシングに由来し、変換行列のスパarsity と非一様性に関する弱い仮定の下で回復保証が得られる。

実験結果

リサーチクエスチョン

  • RQ1最悪の $L_0$ ノイズ(攻撃者が有限個の座標を任意に破損)に耐性を持つスパースフーリエ変換を構築できるか?
  • RQ2このようなロバストな変換を、実用的信号処理で用いられる DCT や DST、ハダマード変換などの他の線形変換に一般化できるか?
  • RQ3JSMA や CW などの強い $L_0$ 攻撃後で、精度がほぼ 0% にまで低下しても、提案手法が分類器の精度を回復できるか?
  • RQ4完全な画像回復が不可能な状況でも、連続的 $L_0$ ノイズ(例:敵対的パッチ)を検出・修正できるか?
  • RQ5攻撃戦略の事前知識がなくても、変換ドメインにおける元の信号のスパarsity に依存するだけで防御が可能か?

主な発見

  • MNIST データセットにおいて、30ピクセルの $L_0$ 攻撃下でネットワークの精度は 88.5% から 24.8% に低下したが、補正アルゴリズム適用後は 83.1% に回復した。
  • 適応的予算を用いたより攻撃的な $L_0$ 攻撃では、精度は 87.8% から 0% に低下したが、提案手法により 85.7% に回復した。
  • ImageNet における敵対的パッチ攻撃では、Top-1 精度が 76.4% から 12.0% に低下したが、補正後は 59.7% に回復した。
  • ImageNet の Top-5 精度は、パッチ付加後 63.9% であったが、補正後は 80.4% に向上。補正画像のうちわずか 4.7% が誤って「トースター」と分類された。
  • Patchwise IHT アルゴリズムは、フーリエドメインにおける残差のスパarsity が最も小さいブロックを同定することで、敵対的パッチを効果的に検出・修正した。
  • 圧縮センシングの仮定に基づく理論的保証により、攻撃戦略の知識がなくても最悪の $L_0$ 敵対者に対してロバストであることが保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。