[论文解读] Privacy-Preserving Collaborative Prediction using Random Forests
本文提出了一种用于随机森林的隐私保护协作预测框架,使多个数据提供方可独立且安全地训练本地模型,并通过加密模型在云端实现预测的可信聚合。该方法避免了训练阶段的高成本密码学计算,实现了高效率,同时通过秘密共享和不经意评估技术维持了强隐私保障。实验结果表明,在真实世界电子健康记录(EHR)数据上,该方法具有竞争力的准确性。
We study the problem of privacy-preserving machine learning (PPML) for ensemble methods, focusing our effort on random forests. In collaborative analysis, PPML attempts to solve the conflict between the need for data sharing and privacy. This is especially important in privacy sensitive applications such as learning predictive models for clinical decision support from EHR data from different clinics, where each clinic has a responsibility for its patients' privacy. We propose a new approach for ensemble methods: each entity learns a model, from its own data, and then when a client asks the prediction for a new private instance, the answers from all the locally trained models are used to compute the prediction in such a way that no extra information is revealed. We implement this approach for random forests and we demonstrate its high efficiency and potential accuracy benefit via experiments on real-world datasets, including actual EHR data.
研究动机与目标
- 解决医疗保健及类似领域中,为提升模型准确性而需数据共享与严格隐私要求之间的冲突。
- 通过将学习过程移至本地数据孤岛,消除模型训练阶段对安全多方计算的需求。
- 设计一种安全、高效且可扩展的系统,用于聚合独立训练的本地随机森林模型的预测结果。
- 通过密码学技术确保预测过程中的隐私,防止模型或输入数据的泄露。
- 在真实世界数据集(包括电子健康记录)上评估该方法,以证明其实际可行性和性能表现。
提出的方法
- 每个数据提供方在其自有数据上独立训练本地随机森林模型,且不共享原始数据。
- 将训练好的模型进行加密,并上传至不可信的云服务器,服务器以加密形式存储这些模型。
- 对于一个新的私有输入,用户向服务器发送加密查询,服务器利用秘密共享和不经意多项式评估技术安全地计算集成预测结果。
- 合并函数通过预定义的聚合策略组合所有本地模型的预测结果,同时保护输入和模型的隐私。
- 协议依赖姚氏混淆电路和不经意传输实现安全两方计算,安全性基于诚实但好奇威胁模型。
- 系统支持水平数据划分,专为云部署设计,支持离线数据提供方与在线服务器协同完成预测。
实验结果
研究问题
- RQ1我们能否在不共享原始训练数据的前提下,利用随机森林实现安全的协作预测?
- RQ2与传统隐私保护训练方法相比,基于本地训练并加密聚合模型的方法在效率和可扩展性方面是否更具优势?
- RQ3所提方法的准确性与在合并数据上训练的集中式模型相比如何?
- RQ4模型超参数和特征数量对系统性能及通信开销有何影响?
- RQ5该方法能否扩展以支持恶意攻击者,特别是被攻陷的服务器?
主要发现
- 所提方法在真实世界数据集(包括电子健康记录)上实现了具有竞争力的预测准确性,性能表现因数据集特性与分布而异。
- 系统表现出高效率,通信与计算开销显著低于传统隐私保护训练协议。
- 性能受特征数量和森林超参数的影响,可通过调优实现效率优化。
- 通过将模型学习去中心化,该方法避免了训练阶段的密码学开销,从而实现更快、更具可扩展性的部署。
- 在诚实但好奇威胁模型下,系统具备安全性,预测过程中未发生模型参数或输入数据的泄露。
- 该方法与差分隐私正交,可在攻击者具备背景知识的威胁模型下提供更强的隐私保障。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。