[論文レビュー] Hide and Seek (HaS): A Lightweight Framework for Prompt Privacy Protection
Hide and Seek (HaS) は、クラウドベースの LLM にプロンプトを送信する前に、機密性の高いエンティティを匿名化し、ローカルで小さなモデルを用いて出力を再匿名化することで、LLM アプリケーションにおけるユーザーのプロンプトのプライバシーを保護する軽量でローカルにデプロイ可能なフレームワークである。最小限のユーティリティ損失で強力なプライバシー保護を実現し、翻訳および分類タスクの両方において、プライバシーの耐性とタスクパフォーマンスの両面で先行手法を上回る性能を発揮する。
Numerous companies have started offering services based on large language models (LLM), such as ChatGPT, which inevitably raises privacy concerns as users' prompts are exposed to the model provider. Previous research on secure reasoning using multi-party computation (MPC) has proven to be impractical for LLM applications due to its time-consuming and communication-intensive nature. While lightweight anonymization techniques can protect private information in prompts through substitution or masking, they fail to recover sensitive data replaced in the LLM-generated results. In this paper, we expand the application scenarios of anonymization techniques by training a small local model to de-anonymize the LLM's returned results with minimal computational overhead. We introduce the HaS framework, where "H(ide)" and "S(eek)" represent its two core processes: hiding private entities for anonymization and seeking private entities for de-anonymization, respectively. To quantitatively assess HaS's privacy protection performance, we propose both black-box and white-box adversarial models. Furthermore, we conduct experiments to evaluate HaS's usability in translation and classification tasks. The experimental findings demonstrate that the HaS framework achieves an optimal balance between privacy protection and utility.
研究の動機と目的
- ユーザーのプロンプトが提供者に晒されるという LLM サービスにおける増大するプライバシーリスクに対処すること。
- MPC の高いオーバーヘッドや匿名化の不可逆性といった既存手法の限界を克服し、ローカルで逆引き可能なプライバシー保護を可能にすること。
- 自由なテキストプロンプト内の名前付きエンティティを保護しながら出力のユーティリティを保持する、即挿し可能なシステムを設計すること。
- ブラックボックスおよびホワイトボックスの敵対的モデルを用いてプライバシー耐性を評価し、復号攻撃に対して耐性があることを保証すること。
- 研究を促進するため、データセットおよびモデルをオープンソース化すること。
提案手法
- HaS フレームワークは、プライバシー保護とエンティティの復元を目的とした 'Hide'(匿名化)と 'Seek'(再匿名化)の二つのプロセスを用いる。
- 二種類の匿名化方式を実装:微調整された Bloomz モデル(560M/1.7B パラメータ)を用いた生成的アプローチと、事前学習済み NER モデルを用いたラベルベースアプローチ。
- 再匿名化プロセスでは、GPT-3.5-turbo がアノテートしたデータで微調整された小型の Bloomz モデルを用い、LLM の出力から元のエンティティを低コストで復元する。
- プライバシー保護の評価には、匿名化を破壊することを目的としたブラックボックスおよびホワイトボックスの敵対的モデルを用い、精度、再現率、F1 スコアを指標に成功度を測定する。
- クラウドベースの LLM を変更せずにローカルにデプロイ可能であり、透明性と互換性を確保する。
- 再現性およびプロンプトプライバシー分野におけるさらなる研究を支援するため、データセットおよびモデルを公開する。
実験結果
リサーチクエスチョン
- RQ1計算コストの高い MPC や DP に依存せずに、軽量でローカルなフレームワークが LLM プロンプト内の機密エンティティを効果的に保護できるか。
- RQ2匿名化および再匿名化のプロセスを経た後でも、翻訳およびテキスト分類といった下流タスクにおいて、HaS フレームワークがどれほど出力のユーティリティを保持できるか。
- RQ3ブラックボックスおよびホワイトボックスの設定下で、敵対的復号攻撃に対して HaS の匿名化方式はどれほど耐性を示すか。
- RQ4生成的アプローチとラベルベースアプローチの匿名化手法の選択が、プライバシー保護の強度とユーティリティ損失にどのように影響するか。
- RQ5匿名化による情報損失を受けても、再匿名化モデルがどれほど正確に元のエンティティを復元できるか。
主な発見
- 560M モデルを用いた生成的匿名化方式は、分類タスクでマイクロ-F1 91.36% を達成し、匿名化なしのベースラインと比較して F1 スコアがたった 0.17% の上昇にとどまり、ユーティリティ損失が最小限であることが示された。
- ラベルベース方式はマイクロ-F1 で 1.16% の低下を示し、ユーティリティの劣化が顕著であったが、依然として高いパフォーマンスを維持した。
- 翻訳タスクでは、560M 生成モデルで METEOR スコアが 5.65% 減少し、ラベルベース方式では 4.86% 減少した。これは、ユーティリティの保持が妥当であることを示している。
- ホワイトボックス攻撃モデルは生成的方式に対してマクロ-F1 0.3212 を達成し、モデルの完全なアクセスが与えられても匿名化方式が依然として耐性を示していることがわかった。
- ブラックボックス攻撃モデルはマクロ-F1 0.3147 を達成し、知識が制限された状況下でも匿名化が堅牢であることが示された。
- シークャー・モデルはラベルベースの匿名化テキストに対してより高い再匿名化精度を示し、情報損失が大きくてもラベルベースのオブスクリューションの方が逆引きが容易である可能性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。