Skip to main content
QUICK REVIEW

[论文解读] Revealing and Protecting Labels in Distributed Training

Trung Dang, Om Thakkar|OpenBU (Boston University)|Oct 31, 2021
Adversarial Robustness in Machine Learning参考文献 34被引用 9
一句话总结

本文提出从梯度中提取标签(Revealing Labels from Gradients, RLG)的方法,用于从分布式学习中的模型权重更新中提取完整训练标签集,适用于使用Softmax和交叉熵损失的各类深度学习架构。实验表明,RLG可在自动语音识别任务中实现高精度的转录重建,并提升现有重建方法的效果;同时,梯度量化和稀疏化可有效缓解该攻击。

ABSTRACT

Distributed learning paradigms such as federated learning often involve transmission of model updates, or gradients, over a network, thereby avoiding transmission of private data. However, it is possible for sensitive information about the training data to be revealed from such gradients. Prior works have demonstrated that labels can be revealed analytically from the last layer of certain models (e.g., ResNet), or they can be reconstructed jointly with model inputs by using Gradients Matching [Zhu et al'19] with additional knowledge about the current state of the model. In this work, we propose a method to discover the set of labels of training samples from only the gradient of the last layer and the id to label mapping. Our method is applicable to a wide variety of model architectures across multiple domains. We demonstrate the effectiveness of our method for model training in two domains - image classification, and automatic speech recognition. Furthermore, we show that existing reconstruction techniques improve their efficacy when used in conjunction with our method. Conversely, we demonstrate that gradient quantization and sparsification can significantly reduce the success of the attack.

研究动机与目标

  • 为解决分布式训练中模型梯度导致的标签隐私泄露风险,特别是在标签(如转录文本)高度敏感的序列建模场景中。
  • 开发一种方法,即使在小批量或多个训练步骤的梯度计算下,也能从权重更新中揭示完整的标签集合。
  • 评估RLG在图像分类(ResNet、EfficientNet)和自动语音识别(基于注意力的编码器-解码器模型)任务中的有效性。
  • 研究梯度压缩技术(如Sign-SGD和GradDrop)在防御标签重建攻击中的作用。
  • 证明将RLG与现有重建方法(如梯度匹配)结合可显著提升性能,尤其在低资源或高词汇量设置下。

提出的方法

  • 提出从梯度中提取标签(Revealing Labels from Gradients, RLG)的技术,通过最后一层梯度和标签到ID的映射关系,从具有Softmax和交叉熵损失的模型中推断出完整的训练标签集。
  • 引入词袋(Bag-of-Words, BoW)约束,以减少序列模型中标签的搜索空间,将优化限制在标签频率而非完整序列顺序上。
  • 将标签恢复问题重新表述为对上下文向量(A)和伪标签分布(P′)的优化,最小化重建梯度与目标梯度之间的L2距离。
  • 采用正则化目标函数:min ||∂L_Bow/∂W_decoder - ∇W_decoder*|| + λℛ(P′),其中ℛ(P′)为正则化项,用于稳定学习过程。
  • 将方法应用于单步小批量更新和单个样本的K步更新,证明其在不同训练模式下的广泛适用性。
  • 将RLG与梯度匹配(Gradients Matching, GM)结合,用于自动语音识别中的完整转录重建,利用BoW引导序列重建,无需语言模型辅助。

实验结果

研究问题

  • RQ1在分布式训练中,是否能从单个梯度更新中可靠地恢复出完整的训练标签集,即使该更新是跨多个样本或步骤聚合而成?
  • RQ2在自动语音识别等高词汇量领域中,RLG在标签恢复方面的有效性如何,尤其是在对所有可能的标签序列进行联合优化不可行的情况下?
  • RQ3梯度量化和稀疏化技术(如Sign-SGD和GradDrop)在多大程度上能缓解标签重建攻击?
  • RQ4掌握标签集合是否能显著提升现有重建方法(如梯度匹配)在序列建模中的性能?
  • RQ5RLG与GM的结合是否能在无语言模型引导的情况下,实现自动语音识别中完整且准确的转录重建?

主要发现

  • RLG成功从图像分类(ResNet和EfficientNet)和自动语音识别任务的梯度中恢复出完整的训练标签集。
  • 在ASR任务中,将RLG与梯度匹配(GM)结合后,在五次运行中达到97.5%的精确匹配(EM)得分,而仅使用GM且无BoW时EM得分仅为1.8%。
  • 使用BoW和多次运行后,转录重建的词错误率(WER)从超过1.0(接近随机)降至0.010,表明重建接近完美。
  • 梯度量化(Sign-SGD)和稀疏化(GradDrop)显著降低了RLG的攻击成功率,证明其在提升通信效率的同时也具备隐私保护作用。
  • 即使在训练初期的模型检查点上,该方法依然有效,在10k训练步时达到40%的精确转录重建率。
  • 使用词袋(BoW)约束可将优化变量数从130k减少至20k,使高词汇量场景下的重建成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。