Skip to main content
QUICK REVIEW

[論文レビュー] Scratch that! An Evolution-based Adversarial Attack against Neural Networks

Malhar Jere, Rossi, Loris|arXiv (Cornell University)|Dec 5, 2019
Adversarial Robustness in Machine Learning参考文献 68被引用数 16
ひとこと要約

本稿では、進化戦略を用いて進化する幾何学的形状(直線またはベジエ曲線)としてモデル化された局所的かつパrametricな摂動である adversarial scratches を提案する。攻撃者はピクセルのわずかな割合しか変更できない制約付きブラックボックス攻撃モデルに従う。この攻撃は、ImageNet で 98.77% の標的成功率、CIFAR-10 で 97.20% の標的成功率を達成し、ピクセルの変更率が 5% 未満である。さらに、Microsoft の Cognitive Services Image Captioning API をも欺くことに成功し、現実世界での実現可能性を示している。

ABSTRACT

We study black-box adversarial attacks for image classifiers in a constrained threat model, where adversaries can only modify a small fraction of pixels in the form of scratches on an image. We show that it is possible for adversaries to generate localized extit{adversarial scratches} that cover less than $5\%$ of the pixels in an image and achieve targeted success rates of $98.77\%$ and $97.20\%$ on ImageNet and CIFAR-10 trained ResNet-50 models, respectively. We demonstrate that our scratches are effective under diverse shapes, such as straight lines or parabolic B\a'ezier curves, with single or multiple colors. In an extreme condition, in which our scratches are a single color, we obtain a targeted attack success rate of $66\%$ on CIFAR-10 with an order of magnitude fewer queries than comparable attacks. We successfully launch our attack against Microsoft's Cognitive Services Image Captioning API and propose various mitigation strategies.

研究の動機と目的

  • 画像に物理的スクラッチを模倣する現実的なブラックボックス攻撃を開発すること。ピクセルのわずかな割合しか変更できないこと。
  • 単一色や単一スクラッチの制約下でも、形状・色・位置の多様な条件下で adversarial scratches の有効性を評価すること。
  • Microsoft の Cognitive Services Image Captioning API を実際に攻撃することで、現実世界への適用可能性を示すこと。
  • JPEG 圧縮、中央値フィルタリング、ピクセルクリッピングを含む実用的な防御手法を提案・評価すること。

提案手法

  • Ad心的スクラッチは、Covariance Matrix Adaptation Evolution Strategy (CMA-ES) を用いてパrametricに進化させる。パラメータにはスクラッチ数、形状(直線またはベジエ曲線)、位置、色が含まれる。
  • フィットネス関数は、ターゲットクラス予測のモデルの信頼度スコアに基づく。ブラックボックス最適化が可能であり、モデル出力へのクエリアクセスのみを必要とする。
  • 攻撃は実際の API のレート制限を模倣するために、クエリ予算を厳密に制限する。実用性を確保する。
  • スクラッチ生成は、[0,1] ピクセル範囲に制限された画像ドメインと、制限のないネットワークドメインの両方で実施する。これにより、攻撃の広範な表面評価が可能になる。
  • 防御は、良性画像における回復率とモデル精度の低下率を用いて評価する。防御手法には JPEG 圧縮、中央値フィルタリング、ピクセルクリッピングが含まれる。
  • 本手法は、CIFAR-10 および ImageNet における ResNet-50、VGG-19、AlexNet に適用され、形状・色・位置に関するアブレーションスタディが実施された。

実験結果

リサーチクエスチョン

  • RQ1制限付きブラックボックス、低クエリ数、低ピクセル変更率の攻撃モデル下で、局所的で幾何的摂動である adversarial scratches は高い標的攻撃成功率を達成できるか?
  • RQ2単一色または単一スクラッチに制限された場合、adversarial scratches の有効性はどの程度で、クエリ効率にどのような影響を与えるか?
  • RQ3adversarial scratches は、Microsoft の Cognitive Services Image Captioning API のような現実世界の商用 API を効果的に回避できるか?
  • RQ4JPEG 圧縮、中央値フィルタリングなどの防御手法の中で、良性モデル性能を保ちながら adversarial scratches を最も効果的に軽減するのはどれか?
  • RQ5元画像とターゲットクラスの意味的類似度と adversarial scratches の成功率の相関関係は何か?

主な発見

  • 攻撃は、ImageNet で 98.77% の標的成功率、CIFAR-10 で 97.20% の標的成功率を達成し、adversarial scratches によるピクセル変更率は 5% 未満であった。
  • 極端な単一色・単一スクラッチの状況下でも、比較的手法よりも 10 倍少ないクエリ数で CIFAR-10 で 66% の標的成功率を達成した。
  • 攻撃は Microsoft の Cognitive Services Image Captioning API を効果的に欺き、誤ったまたは何も出力されないキャプションを生成した。現実世界での攻撃可能性を示している。
  • JPEG 圧縮(品質 99)は、CIFAR-10 のネットワークドメイン攻撃で最高の回復率(82%)を達成し、良性画像での精度低下はたった 0.19% にとどまった。
  • 中央値フィルタリングは画像ドメイン攻撃で最も効果的な防御であった(回復率 81%)。しかし、CIFAR-10 では 13.91% の精度低下を引き起こし、耐性と性能のトレードオフを示した。
  • 画像ドメイン攻撃では [0,1] 範囲へのクリッピングは効果がなかった(回復率 0%)。一方、ネットワークドメインでは 70% の回復率を達成した。防御の有効性がドメイン依存であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。