Skip to main content
QUICK REVIEW

[论文解读] Secret Sharing based Secure Regressions with Applications

Chaochao Chen, Liang Li|arXiv (Cornell University)|Apr 10, 2020
Cryptography and Data Security参考文献 27被引用 4
一句话总结

本文提出基于秘密共享的隐私保护多服务器线性与逻辑回归协议,支持数据持有者之间的隐私计算协作。通过将模型训练简化为安全的矩阵求和与两方乘法,该方法在通信和计算成本线性增长的前提下,实现了与明文模型相同的准确率,展现出在大规模数据集上的可扩展性,并已在金融风控等实际场景中成功部署。

ABSTRACT

Nowadays, the utilization of the ever expanding amount of data has made a huge impact on web technologies while also causing various types of security concerns. On one hand, potential gains are highly anticipated if different organizations could somehow collaboratively share their data for technological improvements. On the other hand, data security concerns may arise for both data holders and data providers due to commercial or sociological concerns. To make a balance between technical improvements and security limitations, we implement secure and scalable protocols for multiple data holders to train linear regression and logistic regression models. We build our protocols based on the secret sharing scheme, which is scalable and efficient in applications. Moreover, our proposed paradigm can be generalized to any secure multiparty training scenarios where only matrix summation and matrix multiplications are used. We demonstrate our approach by experiments which shows the scalability and efficiency of our proposed protocols, and finally present its real-world applications.

研究动机与目标

  • 解决在多个数据持有者之间协作机器学习的同时保护数据隐私的挑战。
  • 开发高效且可扩展的协议,用于在不暴露原始数据的前提下训练线性与逻辑回归模型。
  • 克服以往安全多方计算方法在多参与方场景下泛化能力不足的局限。
  • 实现在金融风控、智能信贷等实际应用中安全回归的实用化部署。
  • 证明安全训练可实现与明文训练相同的模型性能,仅带来线性增长的开销。

提出的方法

  • 利用秘密共享将多方回归训练简化为安全的多方矩阵求和与安全的两方矩阵乘法。
  • 使用秘密共享保护计算过程中的数据输入、模型参数和标签,确保任一参与方均无法获取敏感信息。
  • 将安全的两方矩阵乘法视为黑盒协议,实现对依赖求和与乘法操作的任意训练流程的泛化支持。
  • 采用三阶多项式逼近处理非线性函数(如Sigmoid函数),将其转换为与秘密共享兼容的操作。
  • 实现两种变体:带可信初始化器与不带可信初始化器,以适应不同部署场景。
  • 在隐私约束下采用小批量梯度下降结合自适应学习率搜索进行模型优化。

实验结果

研究问题

  • RQ1能否在最小化计算与通信开销的前提下实现安全的多方回归,同时保护数据隐私?
  • RQ2基于秘密共享的回归方法在准确率与效率方面与明文回归相比表现如何?
  • RQ3所提协议在水平与垂直数据划分设置下,是否能实现与数据规模线性增长的可扩展性?
  • RQ4使用可信初始化器对安全回归中的通信与计算成本有何影响?
  • RQ5该协议能否泛化至其他依赖矩阵运算的机器学习模型,而不仅限于线性与逻辑回归?

主要发现

  • 所提出的秘密共享安全线性与逻辑回归协议在所有基准数据集上均达到与明文模型相同的性能(RMSE与AUC)。
  • 安全模型的运行时间随数据规模线性增长,证实了该方法在大规模数据集上的可扩展性。
  • 在News数据集上,Sec-LiRe-OTI-H耗时78.52秒,而明文线性回归仅需32.41秒,提升约2.4倍,考虑到隐私保障,该开销可接受。
  • 在APS数据集上进行逻辑回归时,Sec-LoRe-OTI-H耗时1,374.45秒,为明文LoRe的9.06倍,主要因多项式逼近引入了额外轮次。
  • 采用可信初始化器(TI)的协议在垂直划分场景下降低了通信成本,避免了特征共享,提升了效率。
  • 该方法已在实际应用中成功部署,包括CDFinance与蚂蚁金融的在线风险控制与自动化信贷系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。