Skip to main content
QUICK REVIEW

[论文解读] Split Learning without Local Weight Sharing to Enhance Client-side Data Privacy

Ngoc Duy Pham, Tran Khoa Phan|arXiv (Cornell University)|Dec 1, 2022
Privacy-Preserving Technologies in Data被引用 5
一句话总结

本文提出隐私增强型分割学习(P-SL),一种新型框架,通过消除客户端之间的本地权重共享,减少多客户端分割学习中的客户端数据泄露。通过阻止客户端共享本地模型权重,P-SL缓解了模型反演攻击,实现高达50%的数据泄露降低,同时在非独立同分布(non-IID)和动态客户端到达条件下,通过服务器端缓存机制保持与标准分割学习相当的准确率。

ABSTRACT

Split learning (SL) aims to protect user data privacy by distributing deep models between client-server and keeping private data locally. In SL training with multiple clients, the local model weights are shared among the clients for local model update. This paper first reveals data privacy leakage exacerbated from local weight sharing among the clients in SL through model inversion attacks. Then, to reduce the data privacy leakage issue, we propose and analyze privacy-enhanced SL (P-SL) (or SL without local weight sharing). We further propose parallelized P-SL to expedite the training process by duplicating multiple server-side model instances without compromising accuracy. Finally, we explore P-SL with late participating clients and devise a server-side cache-based training method to address the forgetting phenomenon in SL when late clients join. Experimental results demonstrate that P-SL helps reduce up to 50% of client-side data leakage, which essentially achieves a better privacy-accuracy trade-off than the current trend by using differential privacy mechanisms. Moreover, P-SL and its cache-based version achieve comparable accuracy to baseline SL under various data distributions, while cost less computation and communication. Additionally, caching-based training in P-SL mitigates the negative effect of forgetting, stabilizes the learning, and enables practical and low-complexity training in a dynamic environment with late-arriving clients.

研究动机与目标

  • 解决多客户端分割学习中因本地权重共享导致的严重隐私漏洞,该漏洞使模型反演攻击成为可能。
  • 在不损害模型准确率或增加通信开销的前提下,增强客户端数据隐私。
  • 通过缓解遗忘现象,支持分割学习中的动态客户端参与,特别是对迟到客户端的支持。
  • 开发一种低复杂度、可扩展的训练框架,适用于具有异构性和非独立同分布(non-IID)数据的现实世界物联网和移动环境。
  • 在分割学习场景中,提供优于差分隐私机制的隐私-准确率权衡。

提出的方法

  • 提出P-SL,一种分割学习的变体,通过在训练过程中移除客户端之间本地模型权重的交换,从而消除数据泄露的主要途径。
  • 采用并行化的P-SL架构,通过多个服务器端模型实例加速训练,同时不损失准确率。
  • 引入服务器端缓存机制,用于存储和重用先前训练客户端的知识,从而在新客户端加入时稳定学习过程。
  • 采用基于缓存的训练策略,仅对迟到客户端进行微调,同时保留已有知识,降低客户端侧的计算和通信开销。
  • 在白盒环境下应用模型反演攻击,以实证方式验证标准SL因本地权重共享而带来的隐私泄露风险。
  • 在实验中采用客户端顺序随机化策略,以评估在不同客户端参与模式下的鲁棒性。

实验结果

研究问题

  • RQ1分割学习中客户端之间的本地权重共享如何加剧数据隐私泄露,特别是在模型反演攻击下?
  • RQ2能否设计一种无需本地权重共享的分割学习框架,以显著降低客户端侧数据泄露,同时保持模型准确率?
  • RQ3如何高效地并行化P-SL以加速训练,同时不牺牲模型性能?
  • RQ4在初始训练后新客户端加入时,应采用何种机制来稳定学习并缓解遗忘现象?
  • RQ5P-SL在非独立同分布(non-IID)数据分布下表现如何,特别是在与标准分割学习和联邦学习的对比中?

主要发现

  • 与标准分割学习相比,P-SL将客户端侧数据泄露降低了高达50%,显著提升了隐私保护,且无需依赖差分隐私机制。
  • P-SL在非独立同分布(non-IID)数据下实现了与标准分割学习(SL)和随机联邦学习(SFL)相当的准确率,未使用缓存时在Fashion-MNIST上测试准确率为56.1%,在CIFAR-10上为47.2%。
  • 基于缓存的P-SL变体将准确率提升至56.1%(Fashion-MNIST)和47.2%(CIFAR-10),表明训练过程更加稳定,并有效缓解了遗忘效应。
  • 使用缓存后,SL和SFL在CIFAR-10上的准确率分别达到92.8%和83.2%,表明缓存机制能显著提升非独立同分布场景下的性能。
  • 缓存机制通过重用存储的知识,使迟到客户端的训练开销降低,显著减少了客户端侧的计算和通信成本。
  • 并行化P-SL在多个服务器端模型实例共享同一缓存池的前提下,保持了模型准确率,同时通过并行处理加速了训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。