[論文レビュー] A Black-box Attack on Neural Networks Based on Swarm Evolutionary Algorithm
本稿では、勾配情報やモデルアーキテクチャの知識を必要とせずに、摂動を生成するスワーム進化的アルゴリズムを用いたニューラルネットワーク向けブラックボックス敵対的攻撃BANAを提案する。本手法はMNISTおよびCIFAR-10で100%の攻撃成功率を達成し、平均で2未満のL2摂動で実現しており、防御的蒸留に対しても効果的に回避可能である。また、固有のランダム性のおかげで、繰り返しのない多様な敵対的サンプルを生成する。
Neural networks play an increasingly important role in the field of machine learning and are included in many applications in society. Unfortunately, neural networks suffer from adversarial samples generated to attack them. However, most of the generation approaches either assume that the attacker has full knowledge of the neural network model or are limited by the type of attacked model. In this paper, we propose a new approach that generates a black-box attack to neural networks based on the swarm evolutionary algorithm. Benefiting from the improvements in the technology and theoretical characteristics of evolutionary algorithms, our approach has the advantages of effectiveness, black-box attack, generality, and randomness. Our experimental results show that both the MNIST images and the CIFAR-10 images can be perturbed to successful generate a black-box attack with 100\% probability on average. In addition, the proposed attack, which is successful on distilled neural networks with almost 100\% probability, is resistant to defensive distillation. The experimental results also indicate that the robustness of the artificial intelligence algorithm is related to the complexity of the model and the data set. In addition, we find that the adversarial samples to some extent reproduce the characteristics of the sample data learned by the neural network model.
研究の動機と目的
- モデルの勾配、重み、アーキテクチャへのアクセスを必要としないブラックボックス敵対的攻撃の開発。
- DNNやCNNを含む多様なディープラーニングモデルに効果的で、高品質かつ見えにくい敵対的サンプルの生成。
- 勾配情報や転送性の仮定に依存する既存の攻撃の限界を克服すること。
- 防御的蒸留という代表的な防御メカニズムに対する耐性の評価。
- モデルの複雑さ、データセットの複雑さ、敵対的耐性の関係の解明。
提案手法
- 摂動を個体集団内の個体として扱い、誤分類成功確率を適応度として定義することで、スワーム進化的アルゴリズム(SEA)を用いて摂動を最適化する。
- 適応度の評価は、勾配計算やモデル構造の知識が不要なブラックボックスクエリによって実施される。
- 局所探索とグローバル探索、適応的突然変異、クラッタリング選択などのメカニズムを用いて収束性と多様性を向上させる。
- 摂動は反復的に進化し、L2距離を最小化すると同時に、ターゲット攻撃またはノンターゲット攻撃における誤分類確率を最大化する。
- ResNet、DenseNet、蒸留モデルを含む複数のアーキテクチャに一般化可能である。
- 進化的プロセスにおけるランダム性のおかげで、同じ入力に対しても実行ごとに異なる敵対的サンプルが生成され、防御に対する耐性が向上する。
実験結果
リサーチクエスチョン
- RQ1勾配情報やモデルアーキテクチャに依存しないブラックボックス敵対的攻撃を構築可能か?
- RQ2スワームベースの進化的アルゴリズムは、多様なモデルにわたって高成功率かつ低可視性の敵対的サンプルを生成可能か?
- RQ3防御的蒸留という知られている耐性機構に対して、本手法の有効性はいかほどか?
- RQ4モデルの複雑さ、データセットの複雑さ、敵対的耐性の間にはどのような関係があるか?
- RQ5敵対的摂動は、モデルの意思決定境界が学習した特徴を反映しているか?
主な発見
- 提案されたBANA攻撃は、MNISTおよびCIFAR-10データセットにおいて、ノンターゲット攻撃およびターゲット攻撃の両方で100%の成功率を達成した。
- MNISTでは平均L2摂動サイズが1.26未満、CIFAR-10では2未満であり、最小限で見えにくい変更であることが示された。
- 蒸留モデルに対しても99.89%の成功率を示し、防御的蒸留に対して耐性があることが確認された。
- スワームアルゴリズムの確率的性質のおかげで、同じ入力に対しても実行ごとに異なる敵対的サンプルが生成され、エビジョン能力が向上した。
- モデルの耐性は、モデルの複雑さとデータセットの複雑さの両方に影響を受けており、より複雑なモデルは敵対的攻撃に対して高い耐性を示した。
- ターゲット攻撃における摂動パターンは、元の数字とターゲット数字の両方の特徴と視覚的に一致しており、敵対的例が学習済みのデータ特性を反映していることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。