[论文解读] Stochastic Distributed Optimization for Machine Learning from Decentralized Features
本文提出FDML,一种用于分布式机器学习的新型异步随机梯度下降框架,其中同一样本的特征分布在多个参与方之间,且不共享原始数据或模型参数。通过仅交换本地预测并利用超线性聚合结构,FDML在保持数据本地性的同时,实现了接近集中式训练的性能,并支持差分隐私,显著提升了腾讯在实际部署中的应用推荐效果。
Distributed machine learning has been widely studied in the literature to scale up machine learning model training in the presence of an ever-increasing amount of data. We study distributed machine learning from another perspective, where the information about the training same samples are inherently decentralized and located on different parities. We propose an asynchronous stochastic gradient descent (SGD) algorithm for such a feature distributed machine learning (FDML) problem, to jointly learn from decentralized features, with theoretical convergence guarantees under bounded asynchrony. Our algorithm does not require sharing the original feature data or even local model parameters between parties, thus preserving a high level of data confidentiality. We implement our algorithm for FDML in a parameter server architecture. We compare our system with fully centralized training (which violates data locality requirements) and training only based on local features, through extensive experiments performed on a large amount of data from a real-world application, involving 5 million samples and $8700$ features in total. Experimental results have demonstrated the effectiveness and efficiency of the proposed FDML system.
研究动机与目标
- 解决当同一样本的特征分布在多个无法共享原始数据或模型参数的参与方时,联合训练机器学习模型的挑战。
- 通过避免在参与方之间传输原始特征或本地模型参数,保护数据本地性并增强隐私。
- 开发一个可扩展且高效的系统,其性能优于仅基于本地特征训练的模型,同时接近集中式训练的性能。
- 将差分隐私集成到通信协议中,进一步保护模型协作过程中的敏感信息。
- 在腾讯应用的真实数据集上评估该框架,证明其在大规模推荐系统中的实际应用价值。
提出的方法
- FDML系统采用参数服务器架构,协调异步更新,各参与方在其自身特征集上独立训练本地模型。
- 各参与方为其小批量样本计算本地预测,并仅将该预测发送至中央服务器,不传输原始特征或模型参数。
- 采用超线性结构(类似于Softmax)将本地预测聚合为分类任务的最终联合预测。
- 系统在过时同步并行(SSP)设置下使用小批量随机梯度下降,支持有界异步性,并具备理论收敛保证。
- 通过向共享的本地预测添加校准噪声,应用差分隐私以防范推理攻击。
- 该框架支持任意模型(如逻辑回归、因子分解机、深度神经网络),并支持联合模型的端到端训练。
实验结果
研究问题
- RQ1当同一样本的特征分布在多个参与方之间且不共享原始数据时,能否有效训练协同机器学习模型?
- RQ2通过FDML训练的联合模型是否能在保持数据本地性的同时,实现与集中式训练相当的性能?
- RQ3在有界异步环境下,系统性能如何?其理论收敛速率是多少?
- RQ4在不显著降低模型性能的前提下,差分隐私在通信协议中可集成到何种程度?
- RQ5在大规模真实数据集上,FDML在通信开销和训练效率方面如何扩展?
主要发现
- FDML显著优于仅基于本地特征训练的模型,在a9a数据集和腾讯500万条记录的数据集上,AUC更高,对数损失更低。
- 对于逻辑回归,FDML性能接近集中式训练,仅因超线性结构中特征交互有限而存在微小差距。
- 对于深度神经网络,FDML性能显著优于本地模型,并接近集中式性能,尽管由于架构中缺乏直接的跨参与方特征交互,仍存在轻微差距。
- 在神经网络设置下,由于分布式计算,FDML比集中式训练更快,尤其在模型较大且通信开销可控时更为明显。
- 在噪声水平高达3的情况下添加差分隐私,其性能仍优于仅本地学习,表明具备强大的隐私-效用权衡能力。
- 在较小数据集(如a9a)上,通信开销占主导,导致FDML比集中式训练更慢,但在更大、更真实的数据集上,该影响逐渐减弱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。