Skip to main content
QUICK REVIEW

[论文解读] Can Language Models be Instructed to Protect Personal Information?

Yang Chen, Ethan Mendes|arXiv (Cornell University)|Oct 3, 2023
Adversarial Robustness in Machine Learning被引用 5
一句话总结

本文提出了PrivQA,一个用于评估语言模型在保护个人身份信息(如国籍或地理位置)指令遵循能力的多模态基准。该研究提出了一种自我审查技术以提升隐私合规性,但发现模型在文本和图像输入下仍易受越狱攻击,凸显了基于指令的隐私控制在鲁棒性方面存在关键缺陷。

ABSTRACT

Large multimodal language models have proven transformative in numerous applications. However, these models have been shown to memorize and leak pre-training data, raising serious user privacy and information security concerns. While data leaks should be prevented, it is also crucial to examine the trade-off between the privacy protection and model utility of proposed approaches. In this paper, we introduce PrivQA -- a multimodal benchmark to assess this privacy/utility trade-off when a model is instructed to protect specific categories of personal information in a simulated scenario. We also propose a technique to iteratively self-moderate responses, which significantly improves privacy. However, through a series of red-teaming experiments, we find that adversaries can also easily circumvent these protections with simple jailbreaking methods through textual and/or image inputs. We believe PrivQA has the potential to support the development of new models with improved privacy protections, as well as the adversarial robustness of these protections. We release the entire PrivQA dataset at https://llm-access-control.github.io/.

研究动机与目标

  • 评估大语言模型中基于指令的隐私控制的有效性。
  • 评估多模态环境下隐私保护与模型效用之间的权衡。
  • 通过对抗性红队测试识别访问控制指令中的漏洞。
  • 开发并基准测试一种可增强隐私合规性的自我审查技术。

提出的方法

  • PrivQA是一个多模态基准,包含文本和视觉问答任务,用于在指定访问控制指令下评估隐私保护能力。
  • 自我审查技术使模型能够在生成前迭代评估并授权响应,从而提升选择性保护能力。
  • 基于GDPR原则定义受保护群体(如意大利公民)和受保护信息(如地理位置)。
  • 红队实验使用越狱提示和多跳攻击测试对抗鲁棒性。
  • 基准包含使用IDEFICS等模型的视觉问答任务,以评估基于图像的攻击向量。
  • 结果通过F1分数和保护分数进行评估,以衡量准确性和合规性。

实验结果

研究问题

  • RQ1当给予访问控制指令时,基于指令遵循的语言模型能否有效保护特定类别的个人信息?
  • RQ2自我审查技术在不降低模型效用的前提下,如何提升模型遵守隐私指令的能力?
  • RQ3通过文本或图像输入,隐私保护在多大程度上易受对抗性越狱技术的攻击?
  • RQ4在相同指令下,不同模型架构(如GPT-4与LLaMA)在隐私合规性方面表现如何比较?
  • RQ5当保护不那么知名或更私密的个体时,模型的性能是否会下降?

主要发现

  • GPT-4在使用自我审查技术时,受保护信息的保护得分为91.5,显著优于基线模型GPT-3.5-turbo(48.5)和LLaMA-70B(73.2)。
  • 自我审查技术将受保护信息(如地理位置)的泄露率从100%降低至0.0%,表明隐私保护能力显著增强。
  • 尽管有所改进,模型对不那么知名个体的保护反而减少,揭示了隐私执行中的偏见。
  • 越狱攻击在100%的测试案例中成功绕过保护机制,仅通过简单文本提示,表明其高度脆弱。
  • 对IDEFICS模型的图像输入可有效绕过访问控制指令,证明视觉输入是新的攻击向量。
  • 自我审查技术在多步过程中提高了敏感性并降低了特异性,且性能因模型架构而异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。