Skip to main content
QUICK REVIEW

[論文レビュー] DaST: Data-free Substitute Training for Adversarial Attacks

Mingyi Zhou, Jing Wu|arXiv (Cornell University)|Mar 28, 2020
Adversarial Robustness in Machine Learning参考文献 41被引用数 13
ひとこと要約

DaSTは、生成対抗ネットワーク(GAN)を用いて、実際のデータを一切使用せずに多様でラベル制御可能な訓練サンプルを合成する、敵対的攻撃のデータフリーな代替訓練手法を提案する。オンラインのAzureモデルにおいて98.35%の攻撃成功率を達成し、実世界のブラックボックス攻撃において強力な転送性と実用性を示す、初めてのデータフリー代替モデル訓練である。

ABSTRACT

Machine learning models are vulnerable to adversarial examples. For the black-box setting, current substitute attacks need pre-trained models to generate adversarial examples. However, pre-trained models are hard to obtain in real-world tasks. In this paper, we propose a data-free substitute training method (DaST) to obtain substitute models for adversarial black-box attacks without the requirement of any real data. To achieve this, DaST utilizes specially designed generative adversarial networks (GANs) to train the substitute models. In particular, we design a multi-branch architecture and label-control loss for the generative model to deal with the uneven distribution of synthetic samples. The substitute model is then trained by the synthetic samples generated by the generative model, which are labeled by the attacked model subsequently. The experiments demonstrate the substitute models produced by DaST can achieve competitive performance compared with the baseline models which are trained by the same train set with attacked models. Additionally, to evaluate the practicability of the proposed method on the real-world task, we attack an online machine learning model on the Microsoft Azure platform. The remote model misclassifies 98.35% of the adversarial examples crafted by our method. To the best of our knowledge, we are the first to train a substitute model for adversarial attacks without any real data.

研究の動機と目的

  • 実際の訓練データを一切必要としないブラックボックス敵対的攻撃の代替モデル訓練手法の開発を目的とする。
  • 実際のデータなしにGANで生成される合成サンプルにおけるクラスの不均衡問題に対処することを目的とする。
  • 訓練中にモデルクエリのみを用いて、実世界のオンライン機械学習モデルに対する効果的な敵対的攻撃を可能とすることを目的とする。
  • 確率のみとラベルのみのブラックボックス攻撃の両状況において、本手法を評価することを目的とする。
  • 完全に合成データから訓練された代替モデルが実用的環境において実現可能で、頑健であることを示すこと

提案手法

  • ラベル分布を制御可能な合成データを生成するために、マルチブランチGANアーキテクチャを活用する。
  • 生成されたサンプルにおけるバランスの取れた包括的なクラスカバレッジを確保するため、ラベル制御損失を導入する。
  • 代替モデルを、ターゲット攻撃対象モデルからの推論によって得られたラベルを備えた合成データ上で訓練する。
  • 2段階の訓練プロセスを採用する:第一段階ではGANが多様な合成サンプルを生成し、第二段階では代替モデルをこれらのクエリラベル付きサンプルで訓練する。
  • ターゲットモデルの出力タイプに応じてクエリインターフェースを適応させることで、確率のみとラベルのみの両攻撃状況をサポートする。
  • 代替モデルに対して勾配ベースの攻撃手法(例:FGSM、BIM、PGD)を用いて、転送可能な敵対的サンプルを生成する。

実験結果

リサーチクエスチョン

  • RQ1実際のデータを一切使用せずに、代替モデルを敵対的攻撃に効果的に訓練できるか?
  • RQ2提案されたラベル制御損失とマルチブランチGANは、合成データにおけるクラスの不均衡をどれほど効果的に軽減できるか?
  • RQ3DaSTは、実世界のオンラインモデルにおいて、ベースライン手法と比較してどの程度の攻撃成功率を達成するか?
  • RQ4DaSTは、確率のみとラベルのみの両ブラックボックス攻撃設定において、どの程度の性能を示すか?
  • RQ5合成データのみで訓練された場合でも、DaSTは実モデルへの高い転送性を達成できるか?

主な発見

  • DaSTは、ラベルのみのクエリを用いて、Microsoft Azureのオンライン機械学習モデルで98.35%の攻撃成功率を達成した。
  • ラベルのみのクエリ(DaST-L)で訓練された代替モデルは、確率のみのクエリ(DaST-P)で訓練されたモデルよりも、MNISTで90.75%の精度を達成した。
  • 非標的PGD攻撃において、DaST-Lは実データで訓練されたベースラインと比較して37.74%高い攻撃成功率を示した。
  • 訓練中、2000万クエリで収束し、DaST-Lでは2000万クエリで攻撃成功率が安定した。
  • DaSTは、小さな摂動(例:距離 ≈ 4.72)を持つ敵対的サンプルを生成でき、クエリベースの攻撃と同等の性能を示したが、評価時にはクエリを一切必要としなかった。
  • 可視化により、合成サンプルが多様で、敵対的サンプルが人間の目では識別不能であることが確認され、効果的なデータ生成と攻撃の転送が実現されたことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。