[论文解读] Federated Evaluation of On-device Personalization
本文提出了联邦个性化评估(FPE),用于评估在联邦学习框架下设备端个性化,展示了隐私保护的评估以及对移动键盘语言模型在用户层面的显著收益。
Federated learning is a distributed, on-device computation framework that enables training global models without exporting sensitive user data to servers. In this work, we describe methods to extend the federation framework to evaluate strategies for personalization of global models. We present tools to analyze the effects of personalization and evaluate conditions under which personalization yields desirable models. We report on our experiments personalizing a language model for a virtual keyboard for smartphones with a population of tens of millions of users. We show that a significant fraction of users benefit from personalization.
研究动机与目标
- 动机:在不损害隐私的前提下,促进在设备端对全局模型进行个性化。
- 将联邦学习框架扩展用于评估个性化策略。
- 识别确保个性化模型提升用户体验的超参数和门控机制。
- 通过大规模实验证明,个性化惠及相当一部分用户。
提出的方法
- 使用基于 CIFG 的 LSTM 下一词预测器,输入/输出嵌入共享权重。
- 用跨数百万客户端的联邦平均(Federated Averaging)训练基础全局模型。
- 通过在每个设备上使用本地数据和定义的训练/测试划分,对全局模型进行微调来实现个性化。
- 通过在本地测试集上对比个性化前后的指标,并上传增量指标来评估个性化。
- 跨客户端聚合增量指标以分析分布并确定有效的超参数。
实验结果
研究问题
- RQ1设备端个性化是否能在不损害他人体验的前提下提升用户体验,以及如何相应地对部署进行门控?
- RQ2哪些超参数(批量大小、学习率、停止准则)能最大化从个性化中受益的用户比例?
- RQ3个性化收益如何随用户数据特征(token 数量、基线准确率)变化?
- RQ4在隐私保护的联邦学习架构下,大规模评估个性化是否可行?
主要发现
- 个性化使平均准确率从0.166提高到0.19,相对提升为14.5%。
- 在超过50万名客户端中,不同的超参数导致达到至少0.02准确度提升的用户比例各不相同(例如 B=5,L=0.1 时为47%,B=10,L=1.0 为39%,B=10,L=0.1 为29%)。
- 在较高学习率下,较小的批量大小可能对某些用户造成更高的退化,这在增量直方图中可见。
- 基线准确率较低的用户往往更能从个性化中受益(例如基线≤0.1时有显著收益)。
- 结果强调了数据感知的超参数调优以及门控机制的重要性,即仅在有益时才部署个性化模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。