[論文レビュー] PrivacyLens: Evaluating Privacy Norm Awareness of Language Models in Action
PrivacyLensは、プライバシー感受性の高いシードから表現的なビニケットとエージェントの軌道を生成することで、実世界のエージェント応用における言語モデルのプライバシーノーム認識を評価する画期的なフレームワークを提案する。プライバシー向上プロンプトが提示されても、GPT-4 や Llama-3-70B といった最先端モデルがそれぞれ25.68%および38.69%のケースで機微な情報を漏洩させることを明らかにした。これは、プローブテストの成績と実際の行動との間に顕著なギャップが存在することを示しており、プライバシー安全性の評価においてプローブタスクだけでは不十分であることを示唆している。
As language models (LMs) are widely utilized in personalized communication scenarios (e.g., sending emails, writing social media posts) and endowed with a certain level of agency, ensuring they act in accordance with the contextual privacy norms becomes increasingly critical. However, quantifying the privacy norm awareness of LMs and the emerging privacy risk in LM-mediated communication is challenging due to (1) the contextual and long-tailed nature of privacy-sensitive cases, and (2) the lack of evaluation approaches that capture realistic application scenarios. To address these challenges, we propose PrivacyLens, a novel framework designed to extend privacy-sensitive seeds into expressive vignettes and further into agent trajectories, enabling multi-level evaluation of privacy leakage in LM agents' actions. We instantiate PrivacyLens with a collection of privacy norms grounded in privacy literature and crowdsourced seeds. Using this dataset, we reveal a discrepancy between LM performance in answering probing questions and their actual behavior when executing user instructions in an agent setup. State-of-the-art LMs, like GPT-4 and Llama-3-70B, leak sensitive information in 25.68% and 38.69% of cases, even when prompted with privacy-enhancing instructions. We also demonstrate the dynamic nature of PrivacyLens by extending each seed into multiple trajectories to red-team LM privacy leakage risk. Dataset and code are available at https://github.com/SALT-NLP/PrivacyLens.
研究の動機と目的
- 言語モデルエージェントにおけるプライバシーノーム認識を測定するための現実的でない評価フレームワークの欠如に取り組むこと。
- 言語モデルのプライバシープローブ質問に対する成績と、エージェントワークフローにおける実際の行動との間の乖離を特定すること。
- ツール拡張型言語モデルの相互作用における文脈依存的プライバシーノームを捉える、スケーラブルで拡張可能なフレームワークを構築すること。
- 特に、カレンダーやメールなどのツールを介して機微なデータにアクセスする際、言語モデルを介した通信における意図しないプライバシー漏洩のリスクを定量化すること。
提案手法
- 文脈的整合性理論を用いて、プライバシー文献とクラウドソーシングされた入力を基に、データ主体、送信者、受信者、伝達方法の各側面におけるノームを定義する。
- テンプレートベースの生成を用いて、各シードを文脈豊かな表現的ビニケットに拡張し、現実的なエージェントシナリオをシミュレートする。
- ユーザーの指示と観察されたデータに基づき、カレンダーの読み取りやメール送信などのツール使用行動を調整して、エージェントの軌道をシミュレートする。
- 最終的なエージェント行動が確立されたプライバシーノームに違反しているかどうかを評価するためのマルチレベル評価パイプラインを用いる。
- 各シードごとに複数の多様な軌道を生成することで、モデルをレッドチーム化し、最悪の漏洩シナリオを特定する。
- コミュニティの利用と拡張を可能にするために、GitHubにデータセットとコードを公開するオープンソースで拡張可能なフレームワークを維持する。
実験結果
リサーチクエスチョン
- RQ1プライバシー保護を促すプロンプトが提示されても、言語モデルが実際の通信ワークフローにおいてエージェントとして振る舞う際、どの程度プライバシーノームに違反するのか。
- RQ2言語モデルのプライバシープローブ質問に対する成績と、エージェントの軌道における実際の行動との相関関係はどの程度か。
- RQ3多様で文脈に依存するシナリオにおいて、言語モデルを介した通信における意図しないプライバシー漏洩の発生頻度はどの程度か。
- RQ4ツール使用と機微なデータへのアクセスを伴うエージェントワークフローにおいて、プライバシーノーム認識を体系的に評価する方法は何か。
- RQ5フレームワークを、プライバシー漏洩リスクを露呈する悪意のある軌道を生成することで、モデルのレッドチーム化に拡張可能か。
主な発見
- GPT-4 や Llama-3-70B といった最先端の言語モデルが、プライバシー向上プロンプトが提示されても、それぞれ25.68%および38.69%のエージェント軌道で機微な情報を漏洩させた。
- プライバシープローブ質問に対する言語モデルの成績と、エージェントワークフローにおける実際の行動との間に顕著な乖離が存在し、プライバシー安全性を評価するにはプローブタスクだけでは不十分であることが示された。
- このフレームワークは、まれだが深刻なプライバシー漏洩事例を露呈する多様で文脈に富んだエージェント軌道を効果的に生成できた。
- PrivacyLensフレームワークは、各シードごとに複数の軌道を生成することで、ツール拡張型エージェント行動における隠れたプライバシーリスクを特定する動的レッドチーム化を可能にした。
- データセットとコードはCC BYライセンスの下で公開されており、コミュニティによる利用と拡張が可能で、エージェント型言語モデルにおけるプライバシーノーム認識の評価を支援する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。