Skip to main content
QUICK REVIEW

[论文解读] Helen: Maliciously Secure Coopetitive Learning for Linear Models

Wenting Zheng, Raluca Ada Popa|arXiv (Cornell University)|Jul 16, 2019
Privacy-Preserving Technologies in Data参考文献 68被引用 12
一句话总结

Helen 是一种针对合作竞争学习的恶意安全系统,允许多方在不泄露其私有数据的情况下协作训练线性模型(如岭回归和LASSO)。通过结合ADMM与优化的密码学技术,Helen 的训练速度相比使用最先进的MPC框架的基线系统快达 10 万倍,将一个 4 方、10 万条样本的数据集的训练时间从数月缩短至 3 小时以内。

ABSTRACT

Many organizations wish to collaboratively train machine learning models on their combined datasets for a common benefit (e.g., better medical research, or fraud detection). However, they often cannot share their plaintext datasets due to privacy concerns and/or business competition. In this paper, we design and build Helen, a system that allows multiple parties to train a linear model without revealing their data, a setting we call coopetitive learning. Compared to prior secure training systems, Helen protects against a much stronger adversary who is malicious and can compromise m-1 out of m parties. Our evaluation shows that Helen can achieve up to five orders of magnitude of performance improvement when compared to training using an existing state-of-the-art secure multi-party computation framework.

研究动机与目标

  • 解决隐私和竞争敏感型组织之间无法共享原始数据的情况下协作机器学习的挑战。
  • 设计一种系统,为最多 m−1 个参与方被攻破的恶意攻击者提供强安全保证。
  • 在合作竞争环境中实现正则化线性模型训练的实际性能,使所有参与方都能从最终模型中获益。
  • 通过优化密码学计算,克服通用MPC框架的低效性,使系统性能与数据规模无关。

提出的方法

  • Helen 使用交替方向乘子法(ADMM)将训练过程与每条样本的密码学操作解耦,从而实现高效的可信计算。
  • 重新表述优化过程,使昂贵的密码学操作仅依赖于模型参数和特征,而不依赖于训练样本数量。
  • 系统采用一种专为线性模型训练定制的高效MPC协议,最大限度减少通信和计算开销。
  • Helen 集成安全多方计算原原子,确保即使有最多 m−1 个参与方行为恶意,计算结果依然正确且隐私得到保护。
  • 系统支持常见的线性模型,包括普通最小二乘法、岭回归和LASSO,这些模型在科学和金融应用中广泛应用。
  • 系统通过性能优化,显著减少了密码学轮次和数据传输量,极大提升了端到端训练速度。

实验结果

研究问题

  • RQ1在强恶意攻击者威胁模型下,能否实现对线性模型的实用化安全训练系统?
  • RQ2如何将密码学计算与数据规模解耦,以提升安全机器学习中的效率?
  • RQ3哪些架构和算法优化使得性能相比通用MPC基线提升 10 万倍?
  • RQ4ADMM 能否被有效适配到具备强隐私和正确性保证的安全合作竞争训练中?

主要发现

  • Helen 将一个 4 方、10 万条样本、90 个特征的线性回归模型的训练时间,从通用MPC基线估计的 3 个月缩短至 3 小时以内。
  • 与最先进的恶意MPC框架(SPDZ)相比,Helen 的性能最高提升了 10 万倍。
  • 通过使用ADMM重构训练流程,Helen 将昂贵的密码学操作从每条样本的迭代中转移至仅依赖参数的计算,实现了与数据规模成线性关系的可扩展性。
  • 系统支持广泛使用的正则化线性模型,如岭回归和LASSO,使其在医疗和金融等现实应用场景中具有适用性。
  • Helen 提供强安全保证:即使 m−1 个参与方完全恶意,诚实参与方的数据依然保密,且计算结果正确。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。