[论文解读] Federated Learning for Ranking Browser History Suggestions
本文展示了一个隐私保护的联邦学习系统,用于优化 Firefox 的 URL 栏历史记录和书签建议,替代手工设计的 frecency 权重,并将输入成本减少超过半个字符。它展示了部署的鲁棒性,并报告了大规模真实用户训练。
Federated Learning is a new subfield of machine learning that allows fitting models without collecting the training data itself. Instead of sharing data, users collaboratively train a model by only sending weight updates to a server. To improve the ranking of suggestions in the Firefox URL bar, we make use of Federated Learning to train a model on user interactions in a privacy-preserving way. This trained model replaces a handcrafted heuristic, and our results show that users now type over half a character less to find what they are looking for. To be able to deploy our system to real users without degrading their experience during training, we design the optimization process to be robust. To this end, we use a variant of Rprop for optimization, and implement additional safeguards. By using a numerical gradient approximation technique, our system is able to optimize anything in Firefox that is currently based on handcrafted heuristics. Our paper shows that Federated Learning can be used successfully to train models in privacy-respecting ways.
研究动机与目标
- 证明在一个大型软件产品中可以使用联邦学习来实现隐私保护的模型改进。
- 开发适用于在有限的用户交互反馈信号下可部署的健壮优化过程。
- 在基于 frecency 的排序中用可学习参数替代手工设计的启发式权重,同时确保安全性和可解释性。
- 提供适用于真实世界 Firefox 部署的梯度估计和安全聚合机制。
- 通过维护一个通用、可计算的梯度框架,使该方法可复用于除 URL 栏以外的优化。
提出的方法
- 实现一个联邦学习循环,选定的客户端子集基于私有交互计算本地更新并向服务器发送聚合更新。
- 使用点对点的 SVM 风格排序损失,针对基于 frecency 的排序进行调整,以在边际 Delta 下训练模型偏向所选项。
- 采用 Rprop 作为梯度下降优化器,以约束更新并为稳定性与可解释性调整每个权重的步长。
- 通过有限差分法近似梯度,以适应 Firefox 内部的不可微分或难以修改的代码路径,在无需重写核心代码的情况下实现梯度估计。
- 使用 Shield 进行快速原型设计和受控升级路径,通过仿真在实际部署之前验证想法。
- 应用保护措施:从现有的 frecency 模型初始化、约束更新、强制非负权重,并保持较新的访问的权重高于较旧的访问。
实验结果
研究问题
- RQ1在不收集用户数据的前提下,联邦学习是否能有效提升大型软件产品中 URL 栏建议的排序?
- RQ2如何使优化在受限、嘈杂且由用户驱动的反馈下,在现实世界部署中变得健壮且稳定?
- RQ3是否可以对黑盒、手工设计的启发式基于排序系统进行重新参数化,并在隐私保护的前提下通过基于梯度的学习进行改进?
- RQ4在大规模浏览器部署中,哪些梯度估计方法和隐私保护聚合策略是可行的?
主要发现
- 新模型使在选择一个建议之前输入的字符数量减少超过半个字符。
- 该系统已部署给大量 Firefox Beta 用户,并使用约 360,000 名参与者的数据进行训练。
- 优化在约三天的在线阶段进行137次迭代,产生了数百万次梯度更新和数十亿次服务器交互。
- 该方法证明联邦学习可以应用于一个主要产品,超越仿真,具备实际的安全和稳定性考量。
- 该设计采用对排序损失的逐点(pointwise)适应以及基于 Rprop 的优化器,以确保更新的稳定性和有界性。
- 一个去标识的数据集和开源代码已准备就绪以配合该研究(数据集将随后发布)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。