Skip to main content
QUICK REVIEW

[論文レビュー] CAAD 2018: Generating Transferable Adversarial Examples

Yash Sharma, Tiendung Le|arXiv (Cornell University)|Sep 29, 2018
Adversarial Robustness in Machine Learning参考文献 27被引用数 4
ひとこと要約

この論文は、CAAD 2018 コンペティションにおいて、空間的勾配平滑化とランダム化前処理を活用することで、未知のモデルへ高い転送性を示す転送可能な adversarial 例の生成に、最先端の手法を提示している。著者らは、非標的および標的攻撃の両トラックで1位を獲得し、勾配ベースの最適化にランダム化と平滑化を組み合わせることで、計算制約を満たしつつも、転送性が著しく向上することを示した。

ABSTRACT

Deep neural networks (DNNs) are vulnerable to adversarial examples, perturbations carefully crafted to fool the targeted DNN, in both the non-targeted and targeted case. In the non-targeted case, the attacker simply aims to induce misclassification. In the targeted case, the attacker aims to induce classification to a specified target class. In addition, it has been observed that strong adversarial examples can transfer to unknown models, yielding a serious security concern. The NIPS 2017 competition was organized to accelerate research in adversarial attacks and defenses, taking place in the realistic setting where submitted adversarial attacks attempt to transfer to submitted defenses. The CAAD 2018 competition took place with nearly identical rules to the NIPS 2017 one. Given the requirement that the NIPS 2017 submissions were to be open-sourced, participants in the CAAD 2018 competition were able to directly build upon previous solutions, and thus improve the state-of-the-art in this setting. Our team participated in the CAAD 2018 competition, and won 1st place in both attack subtracks, non-targeted and targeted adversarial attacks, and 3rd place in defense. We outline our solutions and development results in this article. We hope our results can inform researchers in both generating and defending against adversarial examples.

研究の動機と目的

  • 未知のモデルを効果的にだますことができる、現実的でブラックボックスな設定における高転送性の adversarial 例を開発すること。
  • 厳密な計算制約および摂動制約を満たしつつ、先行する adversarial 攻撃手法を改善し、転送性を向上させること。
  • 高いクリーン精度を維持しながら、強力な adversarial 攻撃に耐性を持つ堅牢な防御機構を設計すること。
  • 勾配平滑化とランダム化が、転送性および堅牢性の向上にどのように寄与するかを調査すること。
  • 特にモデル固有の脆弱性を利用した、これまでにない強力な攻撃に対して優れた性能を示す防御を提出すること。

提案手法

  • 非標的攻撃では、実時間制約を回避するため、事前に学習された adversarial transformation network (ATN) を用いてオフライン最適化を実行する。
  • 標的攻撃では、勾配ベースの最適化とランダム化前処理を組み合わせることで転送性を向上させるが、当初は時間制限内に収まらなかった。
  • 空間的勾配平滑化は、計算制約を満たしつつも高い転送性を維持する効率的な代替手法として導入された。
  • 最終的なソリューションでは、勾配平滑化と反復的ランダム化を組み合わせることで、時間制限内にさらに転送性を向上させた。
  • 防御では「2 MSB」技術を採用し、入力画像の2つの上位ビットのみをアンサンブルされた adversarially trained モデルに渡すことで、摂動への感受性を低減した。
  • 追加の堅牢性は、軽微なベルヌーイノイズの追加と、上位予測が「ジャイガープズル」クラスである場合に誤分類を回避するクラスパッチ機構によって達成された。

実験結果

リサーチクエスチョン

  • RQ1厳密な時間制約のもとで、勾配平滑化を用いて効率的に転送可能な adversarial 例を生成できるか?
  • RQ2ランダム化と勾配ベース最適化を組み合わせることで、標的攻撃における転送性にどのような影響を与えるか?
  • RQ3ビットレベルの入力操作とノイズ注入に基づく防御は、強力で適応的な攻撃に対してどの程度の堅牢性を向上させられるか?
  • RQ4勾配平滑化は、意図的に設計されていなくても、なぜこれほど強い転送性を示すのか?
  • RQ5攻撃の挙動を事前に把握することで、特定の既知の攻撃(例:ATN)に対して防御を強化できるか?

主な発見

  • 勾配平滑化とランダム化の組み合わせにより、非標的および標的攻撃の両サブトラックで1位を達成し、優れた転送性を示した。
  • 「2 MSB」防御は、ノイズとクラスパッチを追加することで、ATN 攻撃に対して89.3%のクリーン精度と42.0%の堅牢性を達成した。
  • 「ノイズ + 避免」防御バージョンは、ATN 攻撃に対する堅牢性を2.0%から42.0%まで向上させ、モデル固有の知識が防御性能を顕著に向上させることを示した。
  • 勾配平滑化単体でも、純粋なランダム化よりも高い転送性を達成しており、「Grad + Rand」は白ボックスおよび転送設定の両方で「Rand」を著しく上回った。
  • 「ドロップアウト」防御は、クリーンデータに対する精度はやや低かったが、ATN 攻撃に対して「2 MSB」を上回った。これは、クリーン精度と堅牢性のトレードオフの存在を示している。
  • 最終的な防御ソリューションである「2 MSB」にノイズと回避機構を追加したバージョンは、クリーン精度と堅牢性のバランスに優れており、とりわけ自チームの攻撃に対しても優れた性能を示したため、提出が選ばれた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。