Skip to main content
QUICK REVIEW

[論文レビュー] Defending Against Physically Realizable Attacks on Image Classification

Tong Wu, Liang Tong|arXiv (Cornell University)|Sep 20, 2019
Adversarial Robustness in Machine Learning参考文献 33被引用数 12
ひとこと要約

本稿では、ステッカー や眼鏡フレームなどの現実の物理的攻撃を模倣する新しい抽象的モデルである長方形オクルージョン攻撃(DOA)を導入することで、物理的に実現可能な adversarial 攻撃に対する新たな防御手法を提案する。この手法は、DOA によって生成された例を用いた adversarial training を実行し、その結果、顔認識および交通標識分類タスクにおいて、標準的な adversarial training や randomized smoothing よりも顕著に高い耐性を達成する。

ABSTRACT

We study the problem of defending deep neural network approaches for image classification from physically realizable attacks. First, we demonstrate that the two most scalable and effective methods for learning robust models, adversarial training with PGD attacks and randomized smoothing, exhibit very limited effectiveness against three of the highest profile physical attacks. Next, we propose a new abstract adversarial model, rectangular occlusion attacks, in which an adversary places a small adversarially crafted rectangle in an image, and develop two approaches for efficiently computing the resulting adversarial examples. Finally, we demonstrate that adversarial training using our new attack yields image classification models that exhibit high robustness against the physically realizable attacks we study, offering the first effective generic defense against such attacks.

研究の動機と目的

  • ステッカーによる停止標識への攻撃や adversarial 眼鏡フレームなど、物理的に実現可能な adversarial 攻撃に対する有効な防御の欠如に取り組む。
  • 現存する耐性学習手法(PGD を用いた adversarial training および randomized smoothing)が、現実世界の物理的攻撃に対して果たす限界を評価する。
  • 物理的 adversarial 変更の制約や特徴をよりよく反映する新たな攻撃モデル、すなわち長方形オクルージョン攻撃(DOA)を考案する。
  • DOA を用いた adversarial training が、従来の防御手法と比較して、物理的攻撃に対して顕著に高い耐性を示すことを実証する。

提案手法

  • 攻撃者が画像に小さな、 adversarially 設計された長方形(ステッカー)を配置するという、新たな抽象的 adversarial モデルである長方形オクルージョン攻撃(DOA)を提案する。
  • 分類誤差を最大化するように、長方形の位置と内容を最適化することで、 adversarial オクルージョンを効率的に計算するアルゴリズムを設計する。
  • 標準的な adversarial training 手順を用いて、DOA モデル下で生成された adversarial 例を用いて深層ニューラルネットワークを学習する。
  • 訓練に使用する DOA 例の生成には、網羅的探索および勾配ベース探索戦略を併用し、スケーラブルで効果的な防御学習を実現する。
  • 顔認識における adversarial 眼鏡フレーム攻撃と、ステッカー攻撃を伴う交通標識分類という、2 つの現実世界の物理的攻撃シナリオで防御を評価する。
  • 同じ物理的攻撃設定下で、$l_p$-ノルムに基づく攻撃(PGD、$l_{ ty}$)および randomized smoothing を用いて学習したモデルと、DOA で学習したモデルの性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1PGD を用いた adversarial training や randomized smoothing といった標準的な耐性学習手法は、眼鏡フレームやステッカーといった物理的に実現可能な攻撃に対してどれほど有効であるか?
  • RQ2物理的制約をよりよく反映する、特に長方形オクルージョンを特徴とする新たな adversarial 攻撃モデルは、画像分類器の耐性を向上させることができるか?
  • RQ3提案された DOA モデルを用いた adversarial training は、既存の防御手法と比較して、現実世界の物理的攻撃に対して顕著に高い耐性を示すか?
  • RQ4DOA 防御は、長方形以外の物理的攻撃パターン(例:三角形やハート型マスク)に対しても一般化できるか?
  • RQ5DOA 防御は、デジタルドメインにおける $l_p$-ノルムバウンデッド攻撃(例:PGD)に対してどの程度効果を示すか?

主な発見

  • PGD を用いた adversarial training や randomized smoothing は、物理的攻撃に対して限定的な有効性を示し、耐性が著しく低下する(例:クリーンな正確度が約 98% から物理的ステッカー攻撃下で 5% 未満にまで低下)。
  • DOA を用いた防御は、adversarial 眼鏡フレーム攻撃下で顔認識タスクで 100% の耐性を達成し、PGD で学習したモデル(ε=2 時に 44.04% の耐性)および randomized smoothing(ε=2 時に 39.79% の耐性)を上回る。
  • 交通標識分類においては、DOA で学習したモデルが物理的ステッカー攻撃下でも 95.59% の正確度を維持するが、PGD で学習したモデルは 91.20%、クリーンモデルは 89.54% にとどまる。
  • DOA で学習したモデルは、大きな三角形やハート型マスクといった他のオクルージョンパターンに対しても良好に一般化し、画像の 8% までを占めるようなパターンに対しても高い耐性を維持する。
  • DOA は $l_{ ty}$-バウンデッド PGD 攻撃(例:ε=8 時に 33.40% の耐性)に対しては効果を示さないことが確認され、これは物理的で局所的かつスパースな摂動に特化していることを裏付ける。
  • DOA 防御は $l_0$-制限付き攻撃(例:JSMA)に対しても効果的であり、元のモデルよりも耐性が向上するため、スパarsity 制限付き攻撃への広範な適用可能性が示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。