Skip to main content
QUICK REVIEW

[論文レビュー] Prediction Poisoning: Utility-Constrained Defenses Against Model Stealing Attacks

Tribhuvanesh Orekondy, Bernt Schiele|arXiv (Cornell University)|Apr 1, 2020
Adversarial Robustness in Machine Learning被引用数 8
ひとこと要約

本稿では、ブラックボックスクエリを用いたDNNモデル盗難攻撃を受ける攻撃者の訓練目的を汚染するように、予測を能動的に摂動させる予測汚染(Prediction Poisoning)という予防的防御を提案する。良性ユーザーの有用性への影響を最小限に抑えつつ、攻撃者精度を最大85倍まで低下させ、多様なデータセットおよび攻撃シナリオにおいて、受動的防御を上回る性能を発揮する。

ABSTRACT

High-performance Deep Neural Networks (DNNs) are increasingly deployed in many real-world applications e.g., cloud prediction APIs. Recent advances in model functionality stealing attacks via black-box access (i.e., inputs in, predictions out) threaten the business model of such applications, which require a lot of time, money, and effort to develop. Existing defenses take a passive role against stealing attacks, such as by truncating predicted information. We find such passive defenses ineffective against DNN stealing attacks. In this paper, we propose the first defense which actively perturbs predictions targeted at poisoning the training objective of the attacker. We find our defense effective across a wide range of challenging datasets and DNN model stealing attacks, and additionally outperforms existing defenses. Our defense is the first that can withstand highly accurate model stealing attacks for tens of thousands of queries, amplifying the attacker's error rate up to a factor of 85x with minimal impact on the utility for benign users.

研究の動機と目的

  • クラウドAPI経由で配備された高性能DNNに向けたモデル盗難攻撃の増加する脅威に対処すること。
  • 予測を単に切り詰める受動的防御の限界を克服し、高度な盗難技術に対して効果を発揮しないこと。
  • 正当なユーザーの有用性を維持しつつ、攻撃者の訓練プロセスを能動的に妨害する防御を設計すること。
  • 現実的なクエリ制約下で、多様なデータセットおよびモデル盗難攻撃の亜種に対して、防御の頑健性を評価すること。

提案手法

  • 推論時に、攻撃者が元のモデルを再構築する能力を低下させるように、特定の摂動を予測に導入する。
  • 摂動は、攻撃者のスレーブモデル訓練目的における誤差を最大化するように最適化され、学習プロセスそのものを汚染する。
  • 通常の推論文脈においては微小かつ人間が認識できない摂動を保証することで、良性ユーザーの有用性を維持する。
  • 元のモデルアーキテクチャーやトレーニングプロセスに変更を加えることなく、デプロイ時に適用可能である。
  • 有用性制約の下で、摂動付き予測が正当なユーザーに対して正確であることを保証する。
  • このアプローチは、ImageNet や CIFAR-10 を含むさまざまなDNNアーキテクチャーやデータセットに対して一般化可能で効果的である。

実験結果

リサーチクエスチョン

  • RQ1能動的に予測を操作する防御が、モデル盗難攻撃の性能を顕著に低下させることができるか?
  • RQ2数万回のクエリ制約下で、非常に高い精度を持つモデル盗難攻撃に対して、この防御はどの程度効果を発揮するか?
  • RQ3攻撃者を妨害しつつ、正当なユーザーの有用性をどの程度維持できるか?
  • RQ4予測を単に切り詰めたりぼかしたりする受動的防御と比べて、この防御はどのように優れているか?
  • RQ5多様なデータセットおよびDNNアーキテクチャに対して、この防御は有効に機能するか?

主な発見

  • 提案された予測汚染防御により、汚染されていない訓練データと比較して、攻撃者のモデル精度が最大85倍まで低下した。
  • 良性ユーザーの有用性は維持され、標準ベンチマーク上での予測精度の低下は最小限に抑えられた。
  • 数万回のクエリ制限下で、ImageNet や CIFAR-10 を含む広範なデータセットに対して、この防御は効果を発揮した。
  • 高度なブラックボックス盗難攻撃に対して無効であることが判明した既存の受動的防御を上回った。
  • 攻撃者が洗練されたクエリ戦略や高精度スレーブモデルを用いても、防御は頑健に機能した。
  • この手法は一般化可能であり、アーキテクチャの変更なしに、さまざまなDNNアーキテクチャに適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。