Skip to main content
QUICK REVIEW

[論文レビュー] What Doesn't Kill You Makes You Robust(er): How to Adversarially Train against Data Poisoning

Jonas Geiping, Liam Fowl|arXiv (Cornell University)|Feb 26, 2021
Adversarial Robustness in Machine Learning被引用数 13
ひとこと要約

本論文は、訓練中に悪意ある攻撃を模倣するように設計された汚染例を挿入することにより、データ汚染攻撃に対する防御を目的とした新規の adversarial training フレームワークを提案する。この手法は、優れたロバストネス-精度トレードオフを達成し、適応的攻撃を含む多様な脅威モデルに一般化可能であり、DP-SGD や標準的な adversarial training などの先行防御を上回る性能を示す。

ABSTRACT

Data poisoning is a threat model in which a malicious actor tampers with training data to manipulate outcomes at inference time. A variety of defenses against this threat model have been proposed, but each suffers from at least one of the following flaws: they are easily overcome by adaptive attacks, they severely reduce testing performance, or they cannot generalize to diverse data poisoning threat models. Adversarial training, and its variants, are currently considered the only empirically strong defense against (inference-time) adversarial attacks. In this work, we extend the adversarial training framework to defend against (training-time) data poisoning, including targeted and backdoor attacks. Our method desensitizes networks to the effects of such attacks by creating poisons during training and injecting them into training batches. We show that this defense withstands adaptive attacks, generalizes to diverse threat models, and incurs a better performance trade-off than previous defenses such as DP-SGD or (evasion) adversarial training.

研究の動機と目的

  • 機械学習におけるデータ汚染攻撃の増加する脅威に対処し、悪意ある攻撃者が訓練データを改ざんすることでモデルの挙動を操作することを防ぐ。
  • 既存の防御では、テスト精度が低く、適応的攻撃に対して脆弱である、あるいは特定の脅威モデルに限定された適用性を持つという限界を克服する。
  • 多様なデータ汚染攻撃、特に標的攻撃やバックドア攻撃に耐性を持つ、一般化可能なロバストな防御フレームワークを開発する。
  • テスト時における adversarial な例に効果的であることが証明された adversarial training を、訓練時におけるデータ汚染攻撃に対応するように拡張し、訓練中に悪意ある汚染例を生成・挿入する。

提案手法

  • 本手法は、本物のデータ汚染攻撃を模倣する最悪ケースの摂動を最適化することで、訓練中に悪意ある汚染例を生成する。
  • これらの悪意ある攻撃を模倣した汚染例を訓練バッチに挿入し、モデル最適化中に現実的なデータ汚染シナリオをシミュレートする。
  • モデルが挿入された汚染例への感受性を最小化するように変更された損失関数を用いることで、モデルがロバストになるように訓練する。
  • 事前に汚染データポイントを特定する必要がないため、未知の脅威にリアルタイムで適応可能な動的な汚染生成を可能にする。
  • ランダムノイズパッチ、最適化された最悪ケースパッチ、CutMix を用いた分布内画像パッチの複数の汚染生成戦略を評価する。
  • 標準的な adversarial training と同様の最適化原理を用いるが、それをデータ汚染脅威モデルに適用し、汚染データを訓練分布内の adversarial な例として扱う。

実験結果

リサーチクエスチョン

  • RQ1テスト時における adversarial な例の防御に効果的である adversarial training を、訓練時におけるデータ汚染攻撃に対しても効果的に応用できるか?
  • RQ2既知の防御を回避するように特化して設計された適応的データ汚染攻撃に対して、本手法はどのように性能を発揮するか?
  • RQ3DP-SGD や標準的な adversarial training などの既存防御と比較して、本防御のロバストネス-精度トレードオフはどの程度か?
  • RQ4本防御は、標的汚染攻撃や異なるトリガーパターンを持つバックドア攻撃を含む、多様なデータ汚染脅威モデルに一般化できるか?
  • RQ5訓練中に動的に生成された汚染例を用いることで、静的または事前に特定された汚染データと比較して、より優れた一般化性とロバストネスが得られるか?

主な発見

  • 本手法は、4×4 のセマンティックな firefox ロゴパッチに対する攻撃成功確率を平均でわずか 25.80% に抑える一方で、防御されていないモデルでは 79.68% に達する。
  • ノイズのチェックパターンパッチに対しても、本手法は汚染成功確率を 29.77% に低下させ、自然な精度が 92.00% を維持する。これはベースライン防御を著しく上回る。
  • 本手法は、異なるトリガー種別に対して良好な一般化性能を示す。分布外のノイズパッチおよび分布内でのセマンティックパッチの両方に対して、強いロバストネスを維持する。
  • 画像ベースのパッチ(例:CutMix 形式)を用いた訓練は、ランダムノイズや最適化されたパッチよりも優れたロバストネスをもたらす。特に意味を持つトリガーに対して顕著である。
  • DP-SGD は自然精度を 69.33% に低下させるが、セマンティックトリガーに対しては極めて脆弱で、汚染精度が 94.40% に達するのに対し、本手法はそれを上回る。
  • 特徴空間の可視化結果から、防御されたモデルは、汚染による特徴シフトへの感受性が低く、よりロバストな表現を学習していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。