Skip to main content
QUICK REVIEW

[论文解读] Private Federated Learning in Gboard

Yuanbo Zhang, Daniel Ramage|arXiv (Cornell University)|Jun 26, 2023
Privacy-Preserving Technologies in Data被引用 5
一句话总结

本文介绍了在Gboard中部署混合隐私保护联邦学习系统,结合用户级差分隐私(DP-FTRL)与安全聚合及分布式差分隐私(SecAgg/DDP),以保护用户输入法数据。该系统在对模型效用影响最小的情况下实现了强大的隐私保障,如在zCDP中ρ = 0.25的生产级语言模型中,预测准确率未下降。

ABSTRACT

This white paper describes recent advances in Gboard(Google Keyboard)'s use of federated learning, DP-Follow-the-Regularized-Leader (DP-FTRL) algorithm, and secure aggregation techniques to train machine learning (ML) models for suggestion, prediction and correction intelligence from many users' typing data. Gboard's investment in those privacy technologies allows users' typing data to be processed locally on device, to be aggregated as early as possible, and to have strong anonymization and differential privacy where possible. Technical strategies and practices have been established to allow ML models to be trained and deployed with meaningfully formal DP guarantees and high utility. The paper also looks ahead to how technologies such as trusted execution environments may be used to further improve the privacy and security of Gboard's ML models.

研究动机与目标

  • 通过结合多种隐私增强技术,提升Gboard联邦学习系统中的用户隐私保护。
  • 解决在基于用户输入模式训练的语言模型中,模型对个体用户数据产生记忆的风险。
  • 在从设备到服务器的整个联邦学习流程中,实现端到端的隐私保护。
  • 提升移动机器学习系统中安全聚合与差分隐私的效率与可扩展性。
  • 为未来利用可信执行环境(TEEs)实现可验证隐私声明奠定基础。

提出的方法

  • 使用DP-FTRL(差分隐私FTRL)在模型参数上提供正式的中心化差分隐私保障,确保用户级隐私。
  • 采用安全聚合(SecAgg)防止服务器在即使为诚实但好奇的情况下,也无法获知单个模型更新。
  • 集成分布式差分隐私(DDP)在传输前对模型更新进行扰动,以防范恶意服务器。
  • 应用子图安全聚合协议以减少通信与计算开销,提升大模型的可扩展性。
  • 实施设备级访问控制、认证令牌与API密钥认证,确保客户端完整性并防止僵尸网络滥用。
  • 通过分层防御策略将DP-FTRL与SecAgg/DDP结合,强化模型训练与聚合每个阶段的隐私边界。

实验结果

研究问题

  • RQ1如何有效结合用户级差分隐私与安全聚合,以保护移动语言模型中的用户输入法数据?
  • RQ2在Gboard的下一个词预测模型中,应用DP-FTRL与SecAgg/DDP对模型效用的影响如何?
  • RQ3DP-FTRL与SecAgg/DDP的结合是否能在不降低模型准确率的前提下,实现更强的端到端隐私保障?
  • RQ4如何在维持低带宽与低内存使用的同时,高效地在数百万台设备上扩展隐私保护联邦学习?
  • RQ5可信执行环境(TEEs)在未来联邦学习系统中,如何在实现可验证隐私声明方面发挥作用?

主要发现

  • 2023年6月,首个使用DP-FTRL与SecAgg/DDP联合训练的语言模型在Gboard中投入生产,用于美国英语的下一个词预测。
  • DP-FTRL + SecAgg/DDP联合模型实现了zCDP隐私预算ρ = 0.25,相比之前模型ρ = 1.31有显著提升。
  • 该模型在预测选择比例与准确率方面与仅使用DP-FTRL训练的基线模型保持一致,表明无效用下降。
  • 使用SecAgg训练的逐键校正触发模型已成功投入生产,质量影响中性。
  • 子图SecAgg协议实现了对不同规模模型(约1k至约300万参数)的高效SecAgg部署。
  • 通过隔离边界、访问控制以及立即丢弃元数据与标识符,系统实现了强大的数据最小化与匿名化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。