Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Examples Make Strong Poisons

Liam Fowl, Micah Goldblum|arXiv (Cornell University)|Jun 21, 2021
Adversarial Robustness in Machine Learning参考文献 52被引用数 33
ひとこと要約

この論文は、固定前提の事前学習モデル上で作成された敵対的事例が高い有効性を持つデータ汚染となり得ることを示し、訓練に使用すると一般化を低下・崩壊させる。クラスを対象とする敵対的汚染バリアントはImageNetのような大規模データセットで特に強い効果をもたらし、Defense研究を促進するためにImageNet-Pを公開する。

ABSTRACT

The adversarial machine learning literature is largely partitioned into evasion attacks on testing data and poisoning attacks on training data. In this work, we show that adversarial examples, originally intended for attacking pre-trained models, are even more effective for data poisoning than recent methods designed specifically for poisoning. Our findings indicate that adversarial examples, when assigned the original label of their natural base image, cannot be used to train a classifier for natural images. Furthermore, when adversarial examples are assigned their adversarial class label, they are useful for training. This suggests that adversarial examples contain useful semantic content, just with the ``wrong'' labels (according to a network, but not a human). Our method, adversarial poisoning, is substantially more effective than existing poisoning methods for secure dataset release, and we release a poisoned version of ImageNet, ImageNet-P, to encourage research into the strength of this form of data obfuscation.

研究の動機と目的

  • データ Poisoningを可用性攻撃として動機づけ、それを敵対的事例と結びつける。
  • 固定モデル上で作られたシンプルで効果的な毒化手法として敵対的 Poisoningを提案する。
  • portabilityと強さを示すためCIFAR-10, ImageNet, 顔認識を横断的に評価。
  • 敵対的事例が強力な毒として機能する理由を分析し、防御の有効性を調査する。

提案手法

  • 固定クリーンモデル(theta*)に対する摂動を最大化する経験的損失最適化として毒化を定式化する。
  • 選択された損失関数で250ステップのPGDを用い、微分可能なデータ拡張を行い毒を作成する。
  • 各ソースクラスをターゲットラベルへ写像するクラス-targeted攻撃を検討し、untargetedとtargetedの性能を比較する。
  • CIFAR-10とImageNet(公開のImageNet-Pを含む)および顔認識設定で評価する。
  • TensorClog, Loss Minimization, Alignment などの既存毒化ベースラインと比較する。
  • adversarial training, various augmentations, DPSGD などの防御をテストして頑健性を評価する。

実験結果

リサーチクエスチョン

  • RQ1固定モデル上で作成された敵対的事例は、可用性攻撃において既存の毒化手法より優れているのか?
  • RQ2敵対的毒が誤ったクラスに意味的内容を提供し、訓練効果が下がるのか?
  • RQ3大規模データセット(ImageNet)および顔認識文脈でクラスターゲット敵対的毒はどう機能するのか?
  • RQ4標準的な防御(敵対的訓練、データ拡張、DPSGD)は敵対的毒に効果的か?

主な発見

  • 敵対的毒はCIFAR-10の複数アーキテクチャでテスト精度を大幅に低下させ、8/255摂動では性能をほぼランダム推定に近づけることがある。
  • CIFAR-10において8/255摂動の敵対的毒化は、ResNet-18の検証精度を約6.25%で、従来手法(例:Alignment 53.67%、Adversarial Poisoning 6.25%)より低くする。
  • ImageNetのクラスターゲット毒は検証精度を劇的に低下させる(例:4/255で45.07%、8/255で36.63%、CT 4/255で3.57%、CT 8/255で1.45%)
  • 顔認識ではクラスターゲット毒が平均精度を8.00%に低下させ、learnableでないサンプル16.00%を上回る。
  • ラベル訂正実験は、作成ネットワークの誤ラベルで汚染データを再ラベリングすることで精度を substantialに回復させ、転送性の非頑健特徴の存在を示す。
  • 敵対的訓練などの防御は毒化効果を緩和するが、自然精度に大きく悪影響を及ぼし計算コストが高い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。