Skip to main content
QUICK REVIEW

[论文解读] Knowledge Sanitization of Large Language Models

Yoïchi Ishibashi, Hidetoshi Shimodaira|arXiv (Cornell University)|Sep 21, 2023
Topic Modeling被引用 4
一句话总结

本文提出知识净化(knowledge sanitization),一种微调方法,可使大型语言模型(LLMs)在被询问敏感或机密信息时,生成预设的无害响应(如“我不知道”)。该方法有效阻止了知识泄露和提取攻击,同时保持了模型在无关知识任务上的整体性能。

ABSTRACT

We explore a knowledge sanitization approach to mitigate the privacy concerns associated with large language models (LLMs). LLMs trained on a large corpus of Web data can memorize and potentially reveal sensitive or confidential information, raising critical security concerns. Our technique efficiently fine-tunes these models using the Low-Rank Adaptation (LoRA) method, prompting them to generate harmless responses such as ``I don't know'' when queried about specific information. Experimental results in a closed-book question-answering task show that our straightforward method not only minimizes particular knowledge leakage but also preserves the overall performance of LLMs. These two advantages strengthen the defense against extraction attacks and reduces the emission of harmful content such as hallucinations.

研究动机与目标

  • 解决因 LLM 从网络训练数据中记忆个人和机密信息而引发的隐私风险。
  • 防止利用 LLM 提取敏感数据(如姓名、地址和电子邮件)的对抗性提取攻击。
  • 开发一种方法,不仅能阻止有害输出,还能确保生成安全的预设响应,以降低幻觉等次级风险。
  • 在净化后保持 LLM 的一般知识能力及在非敏感查询上的性能。
  • 提供一种无需重训练或架构修改的后训练微调解决方案。

提出的方法

  • 该方法采用指令微调,使用触发敏感信息查询的对抗性样本对预训练 LLM 进行微调。
  • 通过训练模型在接收到针对特定机密知识的提示时,输出固定的无害标记序列(如“我不知道”)。
  • 该方法使用提示模板生成对抗性样本,包括以“是 ___”结尾的上下文丰富句子,以测试并训练模型对信息提取的抵抗能力。
  • 微调过程直接应用于现有 LLM(如 LLaMA 和 GPT-J),无需从头开始训练。
  • 通过封闭书问答任务评估模型,以衡量净化效果和一般知识保留能力。
  • 该方法设计为对提示工程攻击(包括越狱攻击和后缀攻击)具有鲁棒性,通过始终以安全响应拒绝敏感查询。

实验结果

研究问题

  • RQ1知识净化能否有效防止 LLM 泄露特定机密信息(如姓名、地址和电子邮件)?
  • RQ2该方法是否保留了 LLM 在净化知识领域之外回答事实性问题的能力?
  • RQ3净化后的模型对对抗性提取攻击(包括基于提示和上下文丰富的攻击)的鲁棒性如何?
  • RQ4该方法能否在不重训练的情况下应用于现有 LLM,仅通过微调实现?
  • RQ5使用预设的无害响应是否能降低幻觉或有害内容生成的风险?

主要发现

  • 当被询问关于敏感信息(如凯撒大帝的名字或妻子)时,净化后的 LLM 一致地以“我不知道”或空白响应,有效阻止了数据泄露。
  • 在提取攻击实验中,即使使用上下文丰富的句子提示,净化后的模型也未生成与凯撒大帝相关的任何信息,显示出对对抗性查询的强大抵抗力。
  • 模型在无关知识任务(如回答关于克利奥帕特拉和波尔塞纳的问题)上保持了高性能,证实了一般知识能力得以保留。
  • 该方法对多种提示工程技术(包括越狱攻击和后缀攻击)表现出鲁棒性,始终生成安全响应而非敏感内容。
  • 该方法成功缓解了信息泄露,且未引入幻觉,因为模型未生成替代或虚构信息。
  • 微调过程高效且有效,无需重训练基础模型,使其可直接应用于现有 LLM。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。