Skip to main content
QUICK REVIEW

[論文レビュー] Last One Standing: A Comparative Analysis of Security and Privacy of Soft Prompt Tuning, LoRA, and In-Context Learning

Rui Wen, Tianhao Wang|arXiv (Cornell University)|Oct 17, 2023
Privacy-Preserving Technologies in DataComputer Science被引用数 3
ひとこと要約

本論文は、プライバシーおよびセキュリティ特性の観点から、Soft Prompt Tuning (SPT)、LoRA、およびIn-Context Learning (ICL) の系統的比較分析を実施している。3つのLLMアーキテクチャおよび4つのNLPデータセットを用いて、メンバーインファレンス攻撃、バックドア攻撃、モデルスティーリング攻撃に対する耐性を評価した結果、どの手法も普遍的に安全またはプライベートとは言えず、ICLはメンバーインファレンス攻撃に対して最も脆弱であり、LoRA/SPTはバックドア攻撃に対してより感受性が高く、すべての手法がモデルスティーリング攻撃に対して脆弱であることが明らかになった。

ABSTRACT

Large Language Models (LLMs) are powerful tools for natural language processing, enabling novel applications and user experiences. However, to achieve optimal performance, LLMs often require adaptation with private data, which poses privacy and security challenges. Several techniques have been proposed to adapt LLMs with private data, such as Low-Rank Adaptation (LoRA), Soft Prompt Tuning (SPT), and In-Context Learning (ICL), but their comparative privacy and security properties have not been systematically investigated. In this work, we fill this gap by evaluating the robustness of LoRA, SPT, and ICL against three types of well-established attacks: membership inference, which exposes data leakage (privacy); backdoor, which injects malicious behavior (security); and model stealing, which can violate intellectual property (privacy and security). Our results show that there is no silver bullet for privacy and security in LLM adaptation and each technique has different strengths and weaknesses.

研究の動機と目的

  • SPT、LoRA、ICLという3つの代表的なLLM適応手法のプライバシーおよびセキュリティ特性を体系的に評価すること。
  • メンバーインファレンス攻撃(プライバシー)、バックドア攻撃(セキュリティ)、モデルスティーリング攻撃(プライバシーおよびセキュリティ)という3つの主要な脅威に対する耐性を評価すること。
  • 機密または機微なデータを含む実世界の展開環境における、各手法の強みと弱みを特定すること。
  • 脅威モデルと脅威表面を考慮した上で、実務家が適応手法を選択するための実用的インサイトを提供すること。

提案手法

  • 本研究では、GPT2、GPT2-XL、LLaMAという3つのLLMアーキテクチャを用いて、SPT、LoRA、ICLの評価を実施している。
  • 性能評価のため、DBPedia、AGNews、TREC、SST-2という4つのベンチマークNLPデータセットを用い、多様なタスクにわたる評価を実施している。
  • データ漏洩リスクを測定するためにメンバーインファレンス攻撃(MIAs)を適用し、攻撃成功確率をプライバシー指標として用いている。
  • バックドア攻撃は、トレーニングデータにトリガーを注入して汚染し、攻撃成功率(ASR)と性能劣化の程度を測定することで評価している。
  • モデルスティーリング攻撃は、クエリベースまたはデータベースの模倣によって、敵が適応モデルをどれだけ容易に再現できるかを測定することでシミュレートしている。
  • 汚染率(0.25、0.5、0.75)とテスト用トリガーの配置(最初の例 vs. 最後の例)を変化させることで、耐性の評価を行っている。
(a) GPT2
(a) GPT2

実験結果

リサーチクエスチョン

  • RQ1SPT、LoRA、ICLは、メンバーインファレンス攻撃に対してどのように耐性を示すか?
  • RQ2汚染率を変化させた場合、各適応手法はバックドア攻撃に対してどの程度感受性を示すか?
  • RQ3合成データ(例:GPT-3.5が生成した例)を用いた場合、これらの手法はモデルスティーリング攻撃に対してどの程度脆弱か?
  • RQ4ICLにおける汚染済み例の配置(プロンプトの先頭 vs. 末尾)は、バックドアの成功に影響を及ぼすか?
  • RQ5モデルサイズやアーキテクチャの違いは、これらの適応手法のセキュリティおよびプライバシー特性にどのように影響を及えるか?

主な発見

  • ICLはメンバーインファレンス攻撃に対して最も高い感受性を示し、LoRA や SPT よりも顕著に高い成功確率を示した。
  • LoRA および SPT は、バックドア攻撃において汚染率が高くなるにつれて攻撃成功率が上昇するが、ICL は全汚染レベルにおいてランダム推測とほぼ同等の水準にとどまった。
  • すべての手法がモデルスティーリング攻撃に対して極めて脆弱であり、GPT-3.5が生成したデータを用いることで高精度なモデル再現が可能であった。
  • ICLにおける汚染済み例の配置(最初 vs. 末尾)は、バックドアの成功にほとんど影響を及ぼさず、入力順序がトリガー効果に与える影響は限定的であることが示された。
  • SPT および LoRA は、特に高い汚染率において高いバックドア成功率を示したが、ICL は少数ショットのデモンストレーションに依存するため、内在的モデル知識に依存しており、結果としてより堅牢であった。
  • 計算効率に優れるものの、いずれの手法も普遍的なプライバシーやセキュリティの利点を提供しないことが判明し、個別の防御策の導入が不可欠であることが強調された。
(b) GPT2-XL
(b) GPT2-XL

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。