Skip to main content
QUICK REVIEW

[論文レビュー] StolenEncoder: Stealing Pre-trained Encoders in Self-supervised Learning

Yupei Liu, Jinyuan Jia|arXiv (Cornell University)|Jan 15, 2022
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

この論文は、自己教師あり学習における事前学習済み画像エンコーダーを標的とした、最初のモデル盗作攻撃であるStolenEncoderを紹介する。EaaS(エンコーダーとしてのサービス)APIに小さなスラッグデータセットを用いてクエリを送信し、データ拡張を適用することで、ターゲットエンコーダーの特徴抽出動作をほぼ完全に模倣する盗作エンコーダーを訓練する。この攻撃は、元のモデルを再訓練するのと比較して、はるかに少ないデータ量と計算リソースで同等の下流分類精度を達成する。

ABSTRACT

Pre-trained encoders are general-purpose feature extractors that can be used for many downstream tasks. Recent progress in self-supervised learning can pre-train highly effective encoders using a large volume of unlabeled data, leading to the emerging encoder as a service (EaaS). A pre-trained encoder may be deemed confidential because its training requires lots of data and computation resources as well as its public release may facilitate misuse of AI, e.g., for deepfakes generation. In this paper, we propose the first attack called StolenEncoder to steal pre-trained image encoders. We evaluate StolenEncoder on multiple target encoders pre-trained by ourselves and three real-world target encoders including the ImageNet encoder pre-trained by Google, CLIP encoder pre-trained by OpenAI, and Clarifai's General Embedding encoder deployed as a paid EaaS. Our results show that our stolen encoders have similar functionality with the target encoders. In particular, the downstream classifiers built upon a target encoder and a stolen one have similar accuracy. Moreover, stealing a target encoder using StolenEncoder requires much less data and computation resources than pre-training it from scratch. We also explore three defenses that perturb feature vectors produced by a target encoder. Our results show these defenses are not enough to mitigate StolenEncoder.

研究の動機と目的

  • エンコーダーとしてのサービス(EaaS)プラットフォームにおいて、公開APIを通じて公開される強力な事前学習済みエンコーダーの知的財産漏洩リスクが増大する状況に対処する。
  • 訓練データやアーキテクチャにアクセスせずに、ターゲット画像エンコーダーの機能的動作を盗作する新しい攻撃手法を開発する。
  • 分類器盗作に対する既存の防御策がエンコーダー盗作に対して有効かどうかを評価し、その限界を同定する。
  • 盗作エンコーダーが下流タスクで元のターゲットエンコーダーと同等の性能を達成できることを実証する。

提案手法

  • スラッグデータセット上で、盗作エンコーダーとターゲットエンコーダーが出力する特徴ベクトルのL2距離を最小化する最適化問題として、エンコーダー盗作問題を定式化する。
  • データ拡張(例:RandomHorizontalFlip、ColorJitter、RandomGrayScale)をスラッグデータセットに適用し、トレーニング中の多様性を高め、一般化性能を向上させる。
  • 二重損失目的関数を導入:L1は元の画像上の類似度を測定し、L2'は拡張画像上の類似度を測定する。両者ともターゲットエンコーダーのAPIクエリを通じて計算される。
  • 非分散の小さなスラッグデータセットを用いることでクエリコストを削減しつつ、拡張と損失最適化により高い性能を維持する。
  • 組み合わせ損失を用いて、盗作エンコーダーをエンドツーエンドで訓練し、その特徴出力をターゲットエンコーダーの出力と一致させる。
  • 下流分類タスクにおける盗作エンコーダーの評価を通じて、機能的忠実度を測定する。

実験結果

リサーチクエスチョン

  • RQ1少数のクエリと小さなスラッグデータセットを用いて、EaaS APIから事前学習済み画像エンコーダーを効果的に盗作できるか?
  • RQ2トレーニング中に適用されるデータ拡張が、盗作エンコーダーの性能と一般化能力に与える影響は何か?
  • RQ3盗作エンコーダーが下流分類タスクにおいて、ターゲットエンコーダーの機能をどの程度再現できるか?
  • RQ4分類器盗作を想定した既存の防御策が、エンコーダー盗作攻撃に対しても有効か?
  • RQ5事前学習から再訓練するのと比較して、エンコーダーを盗作する際の計算リソースとデータ効率はどの程度か?

主な発見

  • CIFAR-10スラッグデータセットに完全なデータ拡張を適用してトレーニングした場合、GTSRBデータセットにおける盗作エンコーダーの下流分類精度は79.94%に達するが、拡張なしでは51.50%にとどまる。
  • 4つのデータ拡張操作(RandomResizedCrop、RandomHorizontalFlip、ColorJitter、RandomGrayScale)をすべて使用した場合が最高のパフォーマンス(79.94%の精度)を示し、拡張の重要性を裏付けている。
  • この攻撃は、元のターゲットエンコーダーと同等の下流パフォーマンスを達成しており、CLIP や Google の ImageNet エンコーダーを含む複数のベンチマークで、ターゲットエンコーダーと同等の精度を再現している。
  • 事前学習から再訓練するのと比較して、盗作エンコーダーははるかに少ないデータ量と計算リソースで実現可能であり、非常に効率的な代替手段である。
  • 分類器盗作に一般的に用いられる信頼度スコアの摂動を施す防御策は、StolenEncoderに対して効果を示さない。なぜなら、攻撃は予測出力ではなく特徴レベルの類似度を標的にしているためである。
  • 本攻撃は、OpenAIのCLIP や Google の ImageNet モデルを含む実世界のEaaSエンコーダーを効果的に盗作でき、実用的実現可能性を確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。