[論文レビュー] Quantifying Privacy Risks of Prompts in Visual Prompt Learning
この論文は、プロンプト学習における視覚的プロンプトのプライバシーリスク評価を初めて包括的に行い、プロンプトが所有権推定攻撃およびメンバーシップ推定攻撃の両方に対して脆弱であることを示している。パrameter数が少ないにもかかわらず、プロンプトはその学習データに関する機密情報を漏洩しており、緩い仮定のもとでも攻撃が成功する可能性がある。これは、プロンプトとしてのサービスにおける重要なプライバシーリスクを示している。
Large-scale pre-trained models are increasingly adapted to downstream tasks through a new paradigm called prompt learning. In contrast to fine-tuning, prompt learning does not update the pre-trained model's parameters. Instead, it only learns an input perturbation, namely prompt, to be added to the downstream task data for predictions. Given the fast development of prompt learning, a well-generalized prompt inevitably becomes a valuable asset as significant effort and proprietary data are used to create it. This naturally raises the question of whether a prompt may leak the proprietary information of its training data. In this paper, we perform the first comprehensive privacy assessment of prompts learned by visual prompt learning through the lens of property inference and membership inference attacks. Our empirical evaluation shows that the prompts are vulnerable to both attacks. We also demonstrate that the adversary can mount a successful property inference attack with limited cost. Moreover, we show that membership inference attacks against prompts can be successful with relaxed adversarial assumptions. We further make some initial investigations on the defenses and observe that our method can mitigate the membership inference attacks with a decent utility-defense trade-off but fails to defend against property inference attacks. We hope our results can shed light on the privacy risks of the popular prompt learning paradigm. To facilitate the research in this direction, we will share our code and models with the community.
研究の動機と目的
- プロンプト学習における視覚的プロンプトが、その学習データから特許情報が漏洩するかどうかを調査すること。
- プロンプトを新たなプライバシー脅威表面として、所有権推定およびメンバーシップ推定攻撃の実現可能性を評価すること。
- モデルレベルの脆弱性とは異なる、入力レベルのプライバシーリスクに特化した、既存の攻撃手法の適応評価。
- 特にノイズベースの緩和法を含む、初期の防御戦略の検討。
提案手法
- メタ分類器をシャドウプロンプトで訓練することで、既存の所有権推定攻撃手法を適応し、プロンプト学習データの感受性のある属性を推定する。
- メンバーシップ推定攻撃(ニューラルネットワークベース、メトリックベース、勾配ベース)を適用し、特定の画像がプロンプトの学習データに含まれていたかどうかを特定する。
- ターゲットプロンプトと同一のデータ分布を使用して複数のシャドウプロンプトを訓練し、攻撃モデルを構築する。
- ガウスノイズをプロンプトに追加して防御機構を評価し、有用性と攻撃成功確率を測定する。
- 実用的状況を想定して、標準的なビジョンベンチマーク(例:CUB-200-2011、Cifar-10)を用いて攻撃および防御のパフォーマンスを評価する。
- 再現可能性およびプロンプトプライバシー分野におけるさらなる研究を可能にするために、コードとモデルを共有する。

実験結果
リサーチクエスチョン
- RQ1攻撃者は、視覚的プロンプトの作成に使われた学習データの感受性のある属性をどの程度正確に推定できるか?
- RQ2特定の画像がプロンプトの学習データに含まれていたかどうかをメンバーシップ推定攻撃で特定できるか?
- RQ3パrameter数が少なく、入力レベルの性質を持つプロンプトに適用した場合、既存のプライバシー攻撃はどの程度有効か?
- RQ4ノイズベースの防御は、メンバーシップ推定攻撃を緩和しつつ、プロンプトの有用性を保持できるか?
- RQ5現在の防御は、プロンプト学習の文脈においてなぜ所有権推定攻撃を保護できないのか?
主な発見
- 視覚的プロンプトは所有権推定攻撃に対して脆弱であり、少数のシャドウプロンプトのみを用いても、攻撃者が学習データの感受性のある属性を成功裏に推定できる。
- メンバーシップ推定攻撃は、学習データ分布へのアクセスが限定されているなど、緩い攻撃者仮定のもとでも効果的である。
- プロンプトにガウスノイズを追加することで、防御効果とモデル有用性の妥当なトレードオフを実現し、メンバーシップ推定攻撃を緩和できる。
- DP-SGDは、プロンプトの有用性を保持できず、所有権推定攻撃に対しても十分な保護を提供できない。
- 提案された防御戦略は所有権推定攻撃に一般化できないため、入力レベルのプライバシーリスクに対する現在の防御アプローチに深刻なギャップがあることが示された。
- 結果として、プロンプト学習はその効率性にもかかわらず、既存の防御では十分にカバーされていない、入力レベルの新たなプライバシーリスクを引き起こすことが明らかになった。
![Figure 2 : Overview of visual prompt learning (VPL). We learn an input prompt via back-propagation [ 4 ] at the input transformation stage. We apply hard-coded mapping [ 13 ] to map the pre-trained model’s outputs into the target labels at the output transformation stage.](https://ar5iv.labs.arxiv.org/html/2310.11970/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。