Skip to main content
QUICK REVIEW

[論文レビュー] Robust Physical-World Attacks on Machine Learning Models.

Ivan Evtimov, Kevin Eykholt|arXiv (Cornell University)|Jul 27, 2017
Adversarial Robustness in Machine Learning参考文献 10被引用数 197
ひとこと要約

この論文は、物理世界で検出を回避するため、破壊やアート風の模造に似せた空間的に制約された adversarial perturbations を生成する新しい攻撃アルゴリズムである Robust Physical Perturbations (RP2) を紹介する。RP2 は、視点の変化、照明、印刷アーティファクトなどの多様な物理的条件下でも、実際の道路標識認識システムを100%欺くことに成功した。具体的には、ストップ・サインがスピード制限サインに誤認識され、右折サインがストップ・サインまたは追加レーンサインに誤認識された。

ABSTRACT

Deep neural network-based classifiers are known to be vulnerable to adversarial examples that can fool them into misclassifying their input through the addition of small-magnitude perturbations. However, recent studies have demonstrated that such adversarial examples are not very effective in the physical world--they either completely fail to cause misclassification or only work in restricted cases where a relatively complex image is perturbed and printed on paper. In this paper we propose a new attack algorithm--Robust Physical Perturbations (RP2)-- that generates perturbations by taking images under different conditions into account. Our algorithm can create spatially-constrained perturbations that mimic vandalism or art to reduce the likelihood of detection by a casual observer. We show that adversarial examples generated by RP2 achieve high success rates under various conditions for real road sign recognition by using an evaluation methodology that captures physical world conditions. We physically realized and evaluated two attacks, one that causes a Stop sign to be misclassified as a Speed Limit sign in 100% of the testing conditions, and one that causes a Right Turn sign to be misclassified as either a Stop or Added Lane sign in 100% of the testing conditions.

研究の動機と目的

  • 環境の変動によって歪みが生じる実世界の物理的状況において、既存の adversarial examples が効果を発揮しないという限界を解決すること。
  • 視点の変化、照明、印刷アーティファクトなどの実世界の画像変換に対して耐性を持つ adversarial perturbations を生成する方法を開発すること。
  • 破壊や芸術的変更を模倣することで、視覚的に目立たなくし、観察者による検出リスクを低減すること。
  • 複数のカメラアングルや環境要因を含む、現実的な物理的条件下での adversarial examples の頑健性を評価すること。
  • 特に道路標識認識のような安全が重要な応用分野における、展開済みの機械学習モデルに対する信頼性のある物理世界攻撃の可能性を実証すること。

提案手法

  • RP2 は、回転、スケーリング、ぼかしなどの実世界の画像変換を攻撃生成段階に組み込む最適化問題として adversarial attack を定式化する。
  • 異なるカメラアングルや照明条件における現実的な画像歪みをシミュレートするために、微分可能レンダリングパイプラインを用いる。
  • 実際の破壊や芸術的改ざんに類似した形で、変更を局所化する空間的制約を課すことで、より高いスパイシー性を実現する。
  • 多様な物理的条件下での高い欺瞞率を達成するように最適化することで、実世界の変動に対する頑健性を確保する。
  • 複数のカメラアングルや環境設定でテストすることで、現実の展開を模擬するマルチビュー評価戦略を採用する。
  • 一般化性能を向上させるために、adversarial training に類似した正則化を導入する。

実験結果

リサーチクエスチョン

  • RQ1視点の変化、照明の変動、印刷アーティファクトなどの実世界の物理的変換に対して、adversarial perturbations を頑健に保てるか。
  • RQ2破壊や芸術的変更を模倣する adversarial examples は、人間による検出を回避しつつも、高い欺瞞率を維持できるか。
  • RQ31つの adversarial perturbation が、複数の物理的条件やカメラアングルにおいて、実世界の道路標識に対して一貫した誤分類を引き起こせるか。
  • RQ4多様で現実的な環境条件下で評価した場合、展開済みの機械学習モデルに対する物理世界攻撃の成功率はどの程度か。
  • RQ5実世界の展開状況において、adversarial examples をどれほどスパイシーかつ効果的にできるか。

主な発見

  • RP2 攻撃は、すべてのテストされた物理的条件下で、ストップ・サインをスピード制限サインに100%の確率で誤認識させることに成功した。
  • 右折サインに対する攻撃は、テスト条件の100%で、ストップ・サインまたは追加レーンサインに誤認識させることに成功した。
  • RP2 が生成したパーソネーションは、自然な破壊や芸術的改ざんと見分がつかず、観察者による検出リスクを顕著に低減した。
  • 視点の変化、照明、画像ぼかしなどの多様な物理的変換に対しても、高い頑健性を示した。
  • 評価手法は現実の変動を的確に捉えており、RP2 が過去の物理世界攻撃よりも信頼性と一般化性能に優れていることを確認した。
  • 物理的実装の結果、印刷された状態で現実の環境下でも adversarial examples が有効であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。