Skip to main content
QUICK REVIEW

[论文解读] PPCA: Privacy-preserving Principal Component Analysis Using Secure Multiparty Computation(MPC)

Xiaoyu Fan, Guosai Wang|arXiv (Cornell University)|May 17, 2021
Privacy-Preserving Technologies in Data参考文献 45被引用 5
一句话总结

本文提出PPCA,一种基于安全多方计算(MPC)的隐私保护主成分分析框架,通过针对MPC性能特征优化算法设计,使现有基于MPC的PCA方法的性能提升了200倍。该方法利用MPC感知技术,如操作替换、批量处理和高效的特征值分解,实现在水平和垂直划分的数据集上快速、私密的PCA,且不会泄露敏感数据分布信息。

ABSTRACT

Privacy-preserving data mining has become an important topic. People have built several multi-party-computation (MPC)-based frameworks to provide theoretically guaranteed privacy, the poor performance of real-world algorithms have always been a challenge. Using Principal Component Analysis (PCA) as an example, we show that by considering the unique performance characters of the MPC platform, we can design highly effective algorithm-level optimizations, such as replacing expensive operators and batching up. We achieve about 200$ imes$ performance boost over existing privacy-preserving PCA algorithms with the same level of privacy guarantee. Also, using real-world datasets, we show that by combining multi-party data, we can achieve better training results.

研究动机与目标

  • 解决基于MPC的隐私保护数据挖掘中的关键性能瓶颈,特别是针对PCA等复杂算法。
  • 通过设计针对MPC计算特性量身定制的算法级优化,克服简单移植MPC带来的低效问题。
  • 通过整合多方数据实现隐私保护PCA的高效与有效,而不会暴露敏感信息。
  • 展示经过MPC优化的PCA在整合多源数据时可提升下游模型性能。
  • 为在MPC平台上优化其他数据挖掘算法提供可复用的方法论,包括操作替换、批量处理和算法重构。

提出的方法

  • 设计一种安全的协方差矩阵计算方法,通过在本地计算部分结果并利用MPC聚合,避免对原始数据进行完整加密。
  • 将MPC中昂贵的操作(如倒数和开方)替换为更廉价的替代方案,如比较操作和迭代近似方法(例如牛顿法),以降低延迟。
  • 实现一种批量排序算法(batch_sort),在排序特征值时提升性能,利用MPC并行处理多个元素的能力。
  • 采用雅可比特征值分解方法而非QR位移法,因其具有更好的并行潜力和更少的迭代次数,尽管单次迭代成本更高。
  • 提出一种特征值排序归约技术(EO-reduction),每轮迭代将两个倒数操作替换为一次比较,使特征值分解的计算开销降低18%。
  • 使用兼容MPC的数值方法在加密数据上计算特征值分解,同时保护隐私并最小化通信轮次。

实验结果

研究问题

  • RQ1算法级优化是否能显著提升基于MPC的PCA性能,同时不损害隐私保障?
  • RQ2在MPC约束下,不同特征值分解算法(如雅可比法与QR位移法)的表现如何?哪种更适合安全计算?
  • RQ3操作替换和批量处理在多大程度上可降低MPC中复杂操作(如除法和排序)的计算成本?
  • RQ4使用基于MPC的PCA整合多方数据,是否相比使用孤立数据集能带来更好的下游模型性能?
  • RQ5协方差矩阵是否会泄露关于数据分布的信息?这种泄露能否通过安全计算加以缓解?

主要发现

  • 所提出的PPCA框架在保持等效隐私保障的前提下,相比现有基于MPC的PCA算法实现了200倍的性能提升。
  • 在MPC环境下,雅可比法因具备更好的并行性和更少的顺序依赖关系,其性能优于QR位移法,迭代次数更少,更有利于批量处理。
  • 通过EO-reduction技术,每轮迭代将两个倒数操作替换为一次比较,使特征值分解的性能提升18%。
  • 批量排序(batch_sort)显著提升了特征值排序的性能,降低了MPC环境下的延迟。
  • 在水平划分的物联网数据上,整合9个设备的数据使F1得分从0.71提升至1.0,证明了多方数据融合的优势。
  • 在垂直划分的MOOC数据上,整合10门课程的特征使F1得分从0.73提升至0.77,表明通过数据融合可提升模型泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。