[論文レビュー] Query-Efficient Black-Box Attack by Active Learning
本稿では、アクティブラーニングと多様性を考慮したサンプリングを用いて、正確な代替モデルを訓練するのに必要なクエリ数を削減するクエリ効率の高いブラックボックス攻撃手法を提案する。C&W や DeepFool といった高度なホワイトボックス攻撃を活用し、アクティブラーニングに多様性基準を適用することで、クエリ数を90%以上削減しながらも高い攻撃成功率を維持し、ターゲットモデルとの類似度が85%を超える結果を得た。
Deep neural network (DNN) as a popular machine learning model is found to be vulnerable to adversarial attack. This attack constructs adversarial examples by adding small perturbations to the raw input, while appearing unmodified to human eyes but will be misclassified by a well-trained classifier. In this paper, we focus on the black-box attack setting where attackers have almost no access to the underlying models. To conduct black-box attack, a popular approach aims to train a substitute model based on the information queried from the target DNN. The substitute model can then be attacked using existing white-box attack approaches, and the generated adversarial examples will be used to attack the target DNN. Despite its encouraging results, this approach suffers from poor query efficiency, i.e., attackers usually needs to query a huge amount of times to collect enough information for training an accurate substitute model. To this end, we first utilize state-of-the-art white-box attack methods to generate samples for querying, and then introduce an active learning strategy to significantly reduce the number of queries needed. Besides, we also propose a diversity criterion to avoid the sampling bias. Our extensive experimental results on MNIST and CIFAR-10 show that the proposed method can reduce more than $90\%$ of queries while preserve attacking success rates and obtain an accurate substitute model which is more than $85\%$ similar with the target oracle.
研究の動機と目的
- 攻撃者が代替モデルを訓練するのに数千回のクエリが必要となる、トランスファーベースのブラックボックス攻撃における高いクエリコストを解消すること。
- ランダムまたはヒューリスティックなサンプリングに代えて、情報量の多いサンプルを優先するアクティブラーニング戦略を導入することで、クエリ効率を向上させること。
- アクティブラーニングにおけるサンプリングバイアスを軽減するため、意思決定境界の代表的カバーを確保する多様性基準を導入すること。
- 最先端のホワイトボックス攻撃手法(C&W および DeepFool)とアクティブラーニングを組み合わせたブラックボックストランスファーベース攻撃の有効性を評価すること。
- 提案手法が、ベースライン手法と比較して顕著に少ないクエリ数で、同等またはより高い攻撃成功率を達成できることを示すこと。
提案手法
- C&W および DeepFool 攻撃を用いて、代替モデルの訓練に適した高品質な adversarial 例を収集する。これにより、JSMA よりも劣る手法に代わる。
- アクティブラーニング戦略として、特にエントロピー最大化およびマージンベースの不確実性サンプリングを適用し、ターゲットモデルに対して最も情報量の多いサンプルを選択する。
- 選択されたクエリが情報量が多いだけでなく、意思決定境界の異なる領域に分散するように、多様性基準を導入する。これによりバイアスの低減が図られる。
- アクティブに選択され、多様性を考慮したクエリデータを用いて代替モデルを訓練することで、ターゲットモデルの意思決定境界を模倣する能力が向上する。
- クエリプロセスは初期クエリの小さな集合から開始され、不確実性と多様性に基づいて反復的に新しいサンプルを選択する。クエリ数は初期段階を除き線形に増加する。
- 本手法は MNIST および CIFAR-10 で評価され、ランダムサンプリングおよびリザボアサンプリングを用いるベースライン手法「Raw」との比較が行われた。
実験結果
リサーチクエスチョン
- RQ1C&W や DeepFool といった高度なホワイトボックス攻撃手法は、JSMA よりも優れた手法であるとされるが、ブラックボックス攻撃における代替モデルの訓練データ品質を向上させることができるか?
- RQ2アクティブラーニングを導入することで、ブラックボックス攻撃環境下で正確な代替モデルを訓練するのに必要なクエリ数は、どの程度削減可能か?
- RQ3アクティブラーニングに多様性基準を組み込むことで、代替モデルの一般化性能およびターゲットモデルとの類似度は向上するか?
- RQ4アクティブラーニングと多様性サンプリングを組み合わせることで、クエリ数を著しく削減しながらも攻撃成功率を維持または向上させることができるか?
- RQ5クエリ効率、攻撃成功率、代替モデルの精度の観点から、提案手法はベースライン手法「Raw」と比較してどのように異なるか?
主な発見
- 提案手法はベースラインの「Raw」手法と比較して、クエリ数を90%以上削減し、同等またはより高い攻撃成功率を達成した。
- CIFAR-10 において10%の攻撃成功率を得るため、元の Max Entropy 法では5,000回を超えるクエリが必要であったが、改善された手法では400回未満にまで削減された。
- 改善された手法では、200クエリでターゲットモデルとの類似度が85%に達したのに対し、元のアクティブラーニング手法では600クエリを要した。
- 多様性を考慮した戦略は、代替モデルの意思決定境界がターゲットオラクルの境界に一致するまでの収束を顕著に加速した。
- CIFAR-10 において、ターゲットモデルの精度が10%未満に低下するまでに必要なクエリ数は、ベースラインで10,000回を超えていたが、改善手法では1,000回未満にまで削減された。
- C&W/DeepFool に基づくデータ生成と、多様性を考慮したアクティブラーニングの組み合わせは、クエリ効率およびモデル類似度の両面で、すべてのベースラインを上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。