Skip to main content
QUICK REVIEW

[論文レビュー] White-to-Black: Efficient Distillation of Black-Box Adversarial Attacks

Yotam Gil, Yoav Chai|arXiv (Cornell University)|Apr 4, 2019
Adversarial Robustness in Machine Learning参考文献 16被引用数 8
ひとこと要約

本稿では、白ボックス攻撃(HotFlip)の挙動を蒸留することで、テキスト分類モデルに対する adversarial examples の生成を最大39倍高速化するニューラルネットワーク、DistFlip を提案する。勾配ベースの攻撃からの入力-出力ペアを用いて学習することで、DistFlip は同等の攻撃成功率を達成しつつ、効率的なブラックボックス攻撃を可能にした。Google Perspective API において、人間による毒性の確認を踏まえた上で、42% の有毒ラベルを正しく反転させることに成功した。

ABSTRACT

Adversarial examples are important for understanding the behavior of neural models, and can improve their robustness through adversarial training. Recent work in natural language processing generated adversarial examples by assuming white-box access to the attacked model, and optimizing the input directly against it (Ebrahimi et al., 2018). In this work, we show that the knowledge implicit in the optimization procedure can be distilled into another more efficient neural network. We train a model to emulate the behavior of a white-box attack and show that it generalizes well across examples. Moreover, it reduces adversarial example generation time by 19x-39x. We also show that our approach transfers to a black-box setting, by attacking The Google Perspective API and exposing its vulnerability. Our attack flips the API-predicted label in 42\% of the generated examples, while humans maintain high-accuracy in predicting the gold label.

研究の動機と目的

  • 白ボックス攻撃からの知識蒸留により、NLP における adversarial examples の生成をより高速かつ効率的に行う手法の開発。
  • 白ボックス攻撃の挙動を転送することで、勾配アクセスができないシステムに対しても効果的なブラックボックス攻撃を可能にすること。
  • 反復的最適化に基づく手法と比較して、生成時間を大幅に短縮しつつも攻撃の質を維持すること。
  • 摂動後も意味的に有毒なままであることを確認するため、adversarial examples が人間による毒性評価で依然として有毒と判定されることを保証すること。

提案手法

  • 入力文とその adversarial な対応物のラベル付き例を用いて、白ボックス攻撃(HotFlip)の入力-出力挙動を模倣するニューラルネットワーク(DistFlip)を学習する。
  • 元の入力と摂動を加えた入力のペアを用いた教師あり学習により、モデルの予測を反転させる最適な文字入れ替え戦略を学習する。
  • adversarial examples の転送可能性を活用し、Google Perspective API などのブラックボックスモデルへの攻撃に、蒸留モデルを適用する。
  • 勾配推定に基づく選択プロセスを用いて、文の文字を逐次入れ替え、ターゲットモデルの予測が変化するまで繰り返し処理を行う。
  • アテンション機構とベースライン比較(例:ランダムな文字選択)を用いて、蒸留モデルの有効性を評価する。
  • 人間によるアノテーションを用いて、意味的類似性と毒性を検証し、摂動後の例が意味的に意味があり、かつ有毒のまま保たれていることを確認する。

実験結果

リサーチクエスチョン

  • RQ1勾配アクセスが不要な状態でも、ニューラルネットワークが白ボックス攻撃の挙動を効果的に学習・一般化できるか。
  • RQ2元の白ボックス手法と比較して、蒸留モデルがどの程度攻撃の質を維持できるか。
  • RQ3蒸留モデルが実際に Google Perspective API のようなリアルワールドシステムに対してブラックボックス環境で成功裏に適用可能か。
  • RQ4蒸留モデルによって生成された adversarial examples が、人間による評価でも意味的に有毒と判定されるか。

主な発見

  • DistFlip は元の HotFlip 白ボックス攻撃と比較して、19倍〜39倍の高速化を達成し、同等の成功率を示した。
  • 85% の例で平均1.8回のフラップで元のモデルの予測を反転させることができ、HotFlip-10 と同等の性能を示した。
  • Google Perspective API に適用したところ、テストした例の42%で「有毒」ラベルを「非有毒」または「不明」に正しく反転させた。
  • 人間アノテーターによる評価では、攻撃対象となった有毒文の87.6%が依然として「有毒」と判定され、摂動後も意味的毒性が保持されていることが確認された。
  • 蒸留モデルは例間で良好に一般化され、推論時に元のモデルにアクセスできない状況でも高い攻撃品質を維持した。
  • アテンションベースやランダムな文字選択といったベースライン手法に比べ、速度と有効性の両面で DistFlip が優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。