Skip to main content
QUICK REVIEW

[論文レビュー] Manipulating SGD with Data Ordering Attacks

Ilia Shumailov, Zakhar Shumaylov|arXiv (Cornell University)|Apr 19, 2021
Adversarial Robustness in Machine Learning参考文献 41被引用数 7
ひとこと要約

本稿では、SGD学習の確率的性質を悪用してバッチや個々のデータポイントの順序を再配置することで、モデル学習を妨害したりバックドアを挿入したりする、データ順序操作技術「BRRR攻撃」を紹介する。主な貢献は、汚染されたデータやモデルへのアクセスなしに、戦略的なデータ順序制御により、モデルの精度を著しく低下させたり、バックドアを仕込んだりできることを示したことである。ホワイトボックスBOBではCIFAR-10で91%のトリガー精度を達成した。

ABSTRACT

Machine learning is vulnerable to a wide variety of attacks. It is now well understood that by changing the underlying data distribution, an adversary can poison the model trained with it or introduce backdoors. In this paper we present a novel class of training-time attacks that require no changes to the underlying dataset or model architecture, but instead only change the order in which data are supplied to the model. In particular, we find that the attacker can either prevent the model from learning, or poison it to learn behaviours specified by the attacker. Furthermore, we find that even a single adversarially-ordered epoch can be enough to slow down model learning, or even to reset all of the learning progress. Indeed, the attacks presented here are not specific to the model or dataset, but rather target the stochastic nature of modern learning procedures. We extensively evaluate our attacks on computer vision and natural language benchmarks to find that the adversary can disrupt model training and even introduce backdoors.

研究の動機と目的

  • SGD学習中の悪意あるデータ順序操作が、データやモデルアーキテクチャを変更せずにモデル学習を妨害したりバックドアを挿入できるかどうかを調査すること。
  • データバッチ化およびサンプリング順序の操作を通じて、機械学習モデルに対する完全性および可用性攻撃の可能性を評価すること。
  • このような攻撃が、モデルパラメータや学習データへのアクセスが一切ないブラックボックス設定でも有効であることを示すこと。
  • データ順序が確率的勾配降下法およびモデル収束に与える影響の理論的裏付けを分析すること。
  • バッチ順序を制御することで、クリーンなデータとラベルのみを用いてバックドアを挿入できることを示し、新たな汚染攻撃を可能にすること。

提案手法

  • バッチ再順序化(BRR)、再シャッフル、置換の3種類のデータ順序攻撃を提案し、総称してBRRR攻撃と呼ぶ。
  • モデルパラメータの更新を操作するために、クリーンなデータとラベルのみを用いるBatch-Order Poisoning(BOP)およびBatch-Order Backdoor(BOB)技術を導入する。
  • ホワイトボックス設定では、モデル出力をもとにデータ再順序化をガイドする代替モデルを用い、標的のバックドア挿入を実現する。
  • ブラックボックス攻撃者モデルは、ターゲットモデルの勾配やパラメータにアクセスせずに、最適なデータ順序を推定する。
  • バッチサイズを変化させながら、複数のコンピュータビジョン(CIFAR-10、ImageNet)およびNLP(EmbeddingBag、VGG16)ベンチマークに攻撃を適用する。
  • 攻撃成功度を測るため、テスト精度、トリガー精度、トリガー入力時の誤差率といった指標を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1標準的なSGDを用いた深層ニューラルネットワークの学習プロセスを、データ順序のみで著しく妨害できるか?
  • RQ2データやモデルアーキテクチャを変更せずに、バッチの順序のみを制御することで、攻撃者がモデル挙動をどの程度制御できるか?
  • RQ3ホワイトボックスおよびブラックボックス設定において、データ順序攻撃がバックドア挿入にどの程度有効か?
  • RQ4SGDの確率的性質が、データ整合性を保ったまま微妙なデータ再順序化に対してモデルを脆弱にする要因となるか?
  • RQ5アーキテクチャの違い(例:CNN対NLPモデル)が、データ順序バックドア攻撃の成功率に与える影響は何か?

主な発見

  • 1つの悪意ある順序のエポックだけで、モデルの学習プロセスが著しく遅延するか、完全にリセットされることがある。
  • ホワイトボックスBOBは、VGG16を用いたCIFAR-10で91% ± 13のトリガー精度を達成し、歪みのあるデータを用いた従来のバックドア攻撃と同等の性能に近づいた。
  • ブラックボックスBOBは、同じベンチマークで68% ± 19のトリガー精度を達成し、モデルへのアクセスなしでも有効であることを示した。
  • NLP分野では、BOB攻撃がコンマ50個をトリガーとして用い、ホワイトボックス条件下で最大68.76%のトリガー精度を達成した。
  • NLPモデルでは、バッチサイズが大きいほどバックドアの成功率が低下し、バッチレベルのデータ分布および埋め込み集約に敏感であることが示された。
  • 攻撃はモデルやデータセットに依存せず、確率的学習の根本的仮定を狙うため、モデル固有の脆弱性に依存しない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。