Skip to main content
QUICK REVIEW

[論文レビュー] Amplifying Membership Exposure via Data Poisoning

Yufei Chen, Chao Shen|arXiv (Cornell University)|Nov 1, 2022
Adversarial Robustness in Machine Learning被引用数 8
ひとこと要約

本論文は、訓練データをわずかに操作することで機械学習モデルにおけるメンバー情報推定攻撃の露出を拡大する、新たなデータ汚染攻撃を提案する。一般的な不正ラベル攻撃と、検出を避けやすくする最適化に基づくクリーンラベル攻撃を導入しており、モデルの精度を維持しつつも、特定のクラスにおけるメンバー情報推定攻撃の精度を顕著に向上させる。

ABSTRACT

As in-the-wild data are increasingly involved in the training stage, machine learning applications become more susceptible to data poisoning attacks. Such attacks typically lead to test-time accuracy degradation or controlled misprediction. In this paper, we investigate the third type of exploitation of data poisoning - increasing the risks of privacy leakage of benign training samples. To this end, we demonstrate a set of data poisoning attacks to amplify the membership exposure of the targeted class. We first propose a generic dirty-label attack for supervised classification algorithms. We then propose an optimization-based clean-label attack in the transfer learning scenario, whereby the poisoning samples are correctly labeled and look "natural" to evade human moderation. We extensively evaluate our attacks on computer vision benchmarks. Our results show that the proposed attacks can substantially increase the membership inference precision with minimum overall test-time model performance degradation. To mitigate the potential negative impacts of our attacks, we also investigate feasible countermeasures.

研究の動機と目的

  • データ汚染とプライバシー漏洩の交差を調査し、特に汚染がメンバー情報推定攻撃をどのように拡大するかを明らかにすること。
  • 検出を避けやすく、訓練データにおけるプライバシー露出のリスクを高める実用的で巧妙なデータ汚染技術を開発すること。
  • さまざまなモデルアーキテクチャとデータセット、多様な訓練環境下で、これらの攻撃の有効性を評価すること。
  • 早期停止、正則化、DP-SGD などの既存の対策が、提案された攻撃に対してどれほど耐性を示すかを評価すること。
  • オープンワールドのデータ収集が、クリーンラベル汚染を介したプライバシー保護の攻撃を可能にする現実世界の脅威を強調すること。

提案手法

  • 標的クラスにおけるメンバー情報推定の精度を向上させるために、悪意あるサンプルのラベルを操作する汎用的な不正ラベル攻撃を提案する。
  • 転移学習環境において、汚染サンプルを人間には識別できないほどわずかに変更しながらも、正しいラベルを保持する最適化に基づくクリーンラベル汚染攻撃を開発する。
  • メンバー情報推定の成功確率を最大化し、テスト精度の低下を最小限に抑えるように、バイレベル最適化フレームワークを用いて汚染サンプルを生成する。
  • 特徴レベルでの最適化を活用し、人間のモデレーターには無害に見える自然な画像を生成するが、モデルが標的クラスのメンバー情報の記憶を強化するように誘導する。
  • InceptionV3 や MobileNetV2 などの多様なアーキテクチャと、CIFAR-10 や ImageNet などの複数のコンピュータビジョンベンチマークを用いて、攻撃を実装する。
  • 標準的な指標(メンバー情報推定のAUCとFPR=1%におけるTPR)を用いて攻撃の有効性を評価し、テスト精度の変化もモニタリングする。

実験結果

リサーチクエスチョン

  • RQ1従来のモデル精度の低下や誤分類にとどまらず、データ汚染を用いてメンバー情報推定攻撃を拡大することは可能か?
  • RQ2性能に著しい影響を与えないまま、クリーンラベル汚染攻撃がメンバー情報推定の精度をどれほど向上させられるか?
  • RQ3早期停止、重み正則化、DP-SGD といった標準的な対策が、提案された汚染攻撃に対してどれほど効果を示すか?
  • RQ4汚染予算が異なる条件下で、攻撃の性能がさまざまなモデルアーキテクチャとデータセットでどのように変化するか?
  • RQ5クリーンラベル汚染攻撃は、人間のモデレーションを回避しつつも、依然として顕著なプライバシー漏洩を引き起こせるか?

主な発見

  • 提案された不正ラベル汚染攻撃は、InceptionV3 ではメンバー情報推定AUCを 0.598 から 0.621 に、VGG16 では 0.561 から 0.571 に向上させ、テスト精度の低下は最小限に抑えられた。
  • クリーンラベル攻撃は、VGG16 でメンバー情報推定のTPR@FPR=1% を 1.12% から 1.29% に、ResNet50 では 0.88% から 1.08% に向上させ、テスト精度は80%以上を維持した。
  • DP-SGD などの強力な対策下でも、クリーンラベル攻撃は Xception でAUCを 0.541、VGG16 で 0.538 にまで引き上げ、これらの防御の有効性が限定的であることを示した。
  • 攻撃は InceptionV3、MobileNetV2、Xception、VGG16、ResNet50 といった複数のアーキテクチャと、CIFAR-10、ImageNet といった複数のデータセットで有効であり、広範な適用可能性を示した。
  • 特に転移学習環境では、ラベル付けの制御が不要であり、人間観測者には自然に見えるため、クリーンラベル攻撃は特に効果的である。
  • テスト時の性能への影響をわずかに抑えつつも、顕著なプライバシーの拡大を達成しており、モデルの有用性とデータプライバシーの間の強いトレードオフを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。