[论文解读] UnSplit: Data-Oblivious Model Inversion, Model Stealing, and Label Inference Attacks Against Split Learning
本文提出 UnSplit,一种针对分裂学习的新颖数据无关攻击方法,使诚实但好奇的服务器仅凭客户端的模型架构即可恢复客户端输入并盗取功能等效的模型。这些攻击表明,原始分裂学习并未提供有意义的隐私保护,因为服务器仅需极少访问权限即可实现高保真度的输入重建和完美的标签推断,从而破坏了该协议的安全性声明。
Training deep neural networks often forces users to work in a distributed or outsourced setting, accompanied with privacy concerns. Split learning aims to address this concern by distributing the model among a client and a server. The scheme supposedly provides privacy, since the server cannot see the clients' models and inputs. We show that this is not true via two novel attacks. (1) We show that an honest-but-curious split learning server, equipped only with the knowledge of the client neural network architecture, can recover the input samples and obtain a functionally similar model to the client model, without being detected. (2) We show that if the client keeps hidden only the output layer of the model to "protect" the private labels, the honest-but-curious server can infer the labels with perfect accuracy. We test our attacks using various benchmark datasets and against proposed privacy-enhancing extensions to split learning. Our results show that plaintext split learning can pose serious risks, ranging from data (input) privacy to intellectual property (model parameters), and provide no more than a false sense of security.
研究动机与目标
- 揭示分裂学习中根本性的隐私漏洞,该协议本意是在分布式训练过程中保护客户端数据和模型权重。
- 证明仅凭客户端模型架构,服务器即可在不被察觉的情况下执行模型反演和模型盗取攻击。
- 评估现有防御措施(如距离相关性 DCOR)对这些新型攻击的有效性。
- 表明即使通过客户端本地计算输出层实现标签保护,标签仍可被以完美准确度推断。
- 强调亟需比分裂学习默认配置更强的密码学保护机制。
提出的方法
- 模型反演攻击通过基于梯度的优化方法,仅利用客户端的模型架构,最小化服务器重建的特征图与客户端“压碎”数据之间的损失,从而重建客户端输入。
- 模型盗取攻击在服务器端训练一个替代模型,以模仿客户端模型的行为,使用相同的输入重建过程,实现功能等效的模型克隆。
- 标签推断攻击利用客户端本地计算最终输出层的事实;当分裂深度为1时,服务器可利用客户端输出层的梯度,以完美准确度推断标签。
- 这些攻击以无需查询、数据无关的方式实现——无需直接访问客户端数据或标签,仅需模型架构和客户端发送的“压碎”数据。
- 该方法在多个数据集(MNIST、Fashion-MNIST)上进行评估,并针对如 DCOR 等隐私增强防御措施进行测试,使用均方误差(MSE)和视觉保真度作为评估指标。
- 该攻击框架可直接扩展至多客户端场景,无需修改,且在相同威胁模型下仍保持有效性。
实验结果
研究问题
- RQ1仅凭客户端的模型架构,服务器是否能在分裂学习中重建客户端的输入数据?
- RQ2在未访问客户端权重或数据的情况下,服务器在多大程度上可以克隆客户端模型的行为?
- RQ3当仅客户端本地计算输出层时,服务器能否推断出客户端输入的标签?
- RQ4现有防御措施(如距离相关性 DCOR)对这些新型、架构感知的攻击有多有效?
- RQ5增加分裂深度是否能提升安全性,还是该协议本质上对这类攻击存在漏洞?
主要发现
- 分裂学习的服务器仅凭客户端的模型架构和“压碎”数据,即可实现高保真度的客户端输入重建,在分裂深度为3时,Fashion-MNIST数据集上的均方误差(MSE)低至0.18。
- 重建的输入在视觉上与原始输入无法区分,表明尽管协议声称具有隐私保护,但信息泄露程度极为严重。
- 服务器可实现与原始模型性能一致的模型克隆,证明在相同威胁模型下可有效实施模型盗取。
- 当客户端仅本地计算最后一层(分裂深度=1)时,服务器可实现标签推断的完美准确度,完全破坏标签机密性。
- DCOR 等防御措施虽降低了输入重建质量,但无法阻止模型盗取,也未显著阻碍具备架构知识的攻击者恢复输入。
- 这些攻击在面对隐私增强防御措施时依然有效,表明仅凭架构知识即可在分裂学习中实施强大且不可检测的攻击。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。