Skip to main content
QUICK REVIEW

[论文解读] Privacy Side Channels in Machine Learning Systems

Edoardo Debenedetti, Giorgio Severi|arXiv (Cornell University)|Sep 11, 2023
Privacy-Preserving Technologies in Data被引用 6
一句话总结

本文揭示了机器学习系统中的隐私侧信道——攻击者利用系统级组件(如数据过滤、预处理、输出过滤和查询过滤)以远高于独立模型的速率提取私有信息。关键发现是,旨在提升隐私保护的组件(如数据去重和记忆过滤)反而可能创建侧信道,破坏差分隐私保证,并实现对私有密钥的精确重建。

ABSTRACT

Most current approaches for protecting privacy in machine learning (ML) assume that models exist in a vacuum. Yet, in reality, these models are part of larger systems that include components for training data filtering, output monitoring, and more. In this work, we introduce privacy side channels: attacks that exploit these system-level components to extract private information at far higher rates than is otherwise possible for standalone models. We propose four categories of side channels that span the entire ML lifecycle (training data filtering, input preprocessing, output post-processing, and query filtering) and allow for enhanced membership inference, data extraction, and even novel threats such as extraction of users' test queries. For example, we show that deduplicating training data before applying differentially-private training creates a side-channel that completely invalidates any provable privacy guarantees. We further show that systems which block language models from regenerating training data can be exploited to exfiltrate private keys contained in the training set--even if the model did not memorize these keys. Taken together, our results demonstrate the need for a holistic, end-to-end privacy analysis of machine learning systems.

研究动机与目标

  • 研究机器学习流水线中的系统级组件如何无意中创建隐私侧信道。
  • 证明旨在增强隐私的组件(如数据去重和记忆过滤)反而可能削弱隐私保证。
  • 展示自适应攻击者可利用这些侧信道执行增强的成员推断攻击或提取私有测试查询。
  • 揭示孤立模型隐私分析的局限性,并倡导采用整体的、端到端的系统级隐私评估方法。
  • 揭示机器学习系统中安全与隐私之间的张力,尤其是在结合差分隐私和去重防御时。

提出的方法

  • 提出四类隐私侧信道:训练数据过滤、输入预处理、模型输出过滤和查询过滤。
  • 使用具有黑盒或白盒访问权限的自适应攻击者,利用系统组件引入的依赖关系进行攻击。
  • 证明数据去重通过在重复检测中关联用户数据,从而创建侧信道,即使在应用差分隐私训练后,仍可能导致隐私泄露。
  • 利用语言模型中的记忆过滤,逆向工程训练集细节,并从训练数据中重建私有密钥。
  • 利用有状态的查询过滤器,跨用户聚合信息,创建泄露其他用户私有测试查询的侧信道。
  • 在真实系统(包括GitHub Copilot和公开的大型语言模型)上进行实证评估,以验证侧信道攻击的有效性。

实验结果

研究问题

  • RQ1系统级组件(如数据去重或输出过滤)如何创建隐私侧信道,从而破坏形式化的隐私保证?
  • RQ2自适应攻击者在仅具有黑盒访问权限的情况下,能在多大程度上利用系统组件提取私有训练数据或测试查询?
  • RQ3为何将数据去重与差分隐私训练结合,反而会导致比单独使用DP更差的隐私保护效果?
  • RQ4旨在防止记忆输出的输出过滤器,是否可能通过实现近乎完美的成员推断攻击而实际上降低隐私保护?
  • RQ5如何通过跨会话聚合用户输入的有状态查询过滤器创建侧信道,从而泄露其他用户的私有查询?

主要发现

  • 本应提升隐私的数据去重机制,反而创建了完全破坏差分隐私保证的侧信道,即使在差分隐私训练之后依然如此。
  • 语言模型中的记忆过滤器可被利用,从训练集中精确重建私有密钥,即使这些密钥未被模型实际记忆。
  • 旨在阻止原样输出训练数据的输出过滤器,可被用于执行近乎完美的成员推断攻击。
  • 跨会话聚合用户输入的查询过滤器,会创建泄露其他用户私有测试查询的侧信道,这种威胁在孤立模型中不可能出现。
  • 将数据去重与差分隐私训练结合,导致隐私保护效果显著劣于单独使用DP,表明隐私机制之间存在非组合性。
  • 对GitHub Copilot的训练集发起的攻击,通过利用输出过滤机制,成功揭示了其训练数据的确切截止日期,证明了该攻击在现实世界中的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。