[论文解读] Large Language Models are Advanced Anonymizers
本文提出了一种基于大语言模型(LLM)的新型对抗性匿名化框架,利用强大对抗性LLM的反馈,迭代优化文本匿名化过程,显著提升了现有工具在隐私保护和实用性方面的表现。该方法在人类偏好研究和自动化评估中均优于Azure等商业匿名化工具以及基于GPT-4的基线模型,甚至使小型量化LLM也能达到大型模型的性能水平。
Recent privacy research on large language models (LLMs) has shown that they achieve near-human-level performance at inferring personal data from online texts. With ever-increasing model capabilities, existing text anonymization methods are currently lacking behind regulatory requirements and adversarial threats. In this work, we take two steps to bridge this gap: First, we present a new setting for evaluating anonymization in the face of adversarial LLM inferences, allowing for a natural measurement of anonymization performance while remedying some of the shortcomings of previous metrics. Then, within this setting, we develop a novel LLM-based adversarial anonymization framework leveraging the strong inferential capabilities of LLMs to inform our anonymization procedure. We conduct a comprehensive experimental evaluation of adversarial anonymization across 13 LLMs on real-world and synthetic online texts, comparing it against multiple baselines and industry-grade anonymizers. Our evaluation shows that adversarial anonymization outperforms current commercial anonymizers both in terms of the resulting utility and privacy. We support our findings with a human study (n=50) highlighting a strong and consistent human preference for LLM-anonymized texts.
研究动机与目标
- 为应对大语言模型从看似无害的在线文本中推断个人属性的日益增长的威胁。
- 克服当前工业标准匿名化工具的局限性,这些工具无法检测依赖上下文的间接隐私泄露。
- 开发一种基于反馈的对抗性匿名化框架,利用大语言模型的推理能力提升匿名化质量。
- 在真实对抗性推理条件下评估匿名化性能,使其符合监管隐私标准。
- 探索将高性能匿名化能力蒸馏至更小、高效且可能适用于边缘设备的模型的可行性。
提出的方法
- 该框架采用双LLM架构:一个对抗性LLM对当前文本版本进行迭代属性推断。
- 基于推断结果,另一个独立的匿名化LLM通过删除、混淆或泛化隐私泄露线索来修改文本。
- 该过程以多轮迭代方式进行,每轮均对文本进行优化,以降低推断成功率,同时保持文本实用性。
- 匿名化在对抗性推理设置下进行评估,即最终输出会接受强对抗性LLM对手的属性预测测试。
- 该方法使用来自更大模型(如Llama3.1-70B)的合成数据和示范,通过LoRA微调技术对小型模型(如Llama3.1-8B)进行微调。
- 通过一项人类研究(n=50)评估匿名化文本在可读性、语义、自然度和可用性方面的表现,以验证其在现实场景中的性能。
实验结果
研究问题
- RQ1对抗性LLM能否有效识别传统工具所遗漏的上下文依赖型隐私泄露?
- RQ2与静态匿名化相比,基于反馈的迭代式LLM匿名化过程是否能显著提升隐私保护和实用性?
- RQ3小型量化LLM能否在对抗性匿名化中实现与大型模型相当的性能?
- RQ4人类对LLM-based与商业匿名化工具处理的文本在偏好上是否存在显著差异?
- RQ5LLM与人类对匿名化输出的语义和可读性判断在多大程度上保持一致?
主要发现
- 对抗性匿名化框架在隐私保护和实用性方面显著优于Azure等商业工具以及基于GPT-4的匿名化工具,评估指标包括对抗性推理准确率和人类评价。
- 人类偏好研究(n=50)显示,在可读性、语义和可用性等指标上,人们对LLM匿名化文本的偏好显著且一致地高于商业工具处理的文本。
- 经过微调的4-bit量化Llama3.1-8B模型在隐私-实用性权衡上表现接近完整70B模型,证明了其在高效部署中的可行性。
- LLM对LLM匿名化文本的语义和可读性判断与人类判断高度一致;而对Azure匿名化文本,LLM的评分高于人类判断,认为其更具可读性和语义性。
- 即使小型本地部署的LLM也优于商业匿名化工具在隐私保护和实用性方面的表现,表明其在实现可扩展、设备端隐私保护方面具有潜力。
- 该框架成功识别并缓解了传统实体识别工具无法处理的间接隐私泄露——例如通过文化引用推断地理位置等——的威胁。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。