[论文解读] Privacy-Preserving Feature Selection with Secure Multiparty Computation
本论文提出了首个基于安全多方计算(MPC)的协议,用于使用过滤法实现隐私保护的特征选择,特别利用了安全的基尼不纯度评分机制。该协议使多个参与方可联合选择前k个特征,而无需泄露原始数据或特征身份,从而在半诚实和恶意威胁模型下提升分类器的准确性,运行时间根据数据规模和安全设置从几秒到一小时不等。
Existing work on privacy-preserving machine learning with Secure Multiparty Computation (MPC) is almost exclusively focused on model training and on inference with trained models, thereby overlooking the important data pre-processing stage. In this work, we propose the first MPC based protocol for private feature selection based on the filter method, which is independent of model training, and can be used in combination with any MPC protocol to rank features. We propose an efficient feature scoring protocol based on Gini impurity to this end. To demonstrate the feasibility of our approach for practical data science, we perform experiments with the proposed MPC protocols for feature selection in a commonly used machine-learning-as-a-service configuration where computations are outsourced to multiple servers, with semi-honest and with malicious adversaries. Regarding effectiveness, we show that secure feature selection with the proposed protocols improves the accuracy of classifiers on a variety of real-world data sets, without leaking information about the feature values or even which features were selected. Regarding efficiency, we document runtimes ranging from several seconds to an hour for our protocols to finish, depending on the size of the data set and the security settings.
研究动机与目标
- 为填补隐私保护机器学习(PPML)中的空白,将安全计算扩展至数据预处理阶段,特别是特征选择阶段。
- 设计一种安全且高效的MPC协议,实现私有特征排序,而无需暴露原始特征值或选择结果。
- 在真实世界的数据科学场景中,证明所提出协议的可行性和有效性,并具备实际性能表现。
- 通过使用与模型无关的过滤方法,支持与任意下游机器学习模型的集成。
- 为未来针对其他预处理任务(如超参数调优、异常值检测和缺失值处理)的PPML协议奠定基础。
提出的方法
- 提出一种基于MPC的私有特征评分协议,利用基尼不纯度计算,实现在分布式参与方之间安全计算特征相关性得分。
- 设计了一种多参与方计算(MPC)协议 π_GINI-FS,用于基于过滤的特征选择,该协议在 Z_q 上以 3PC 或 4PC 的诚实多数设置下运行,其中 q=2^64。
- 采用一种安全的基尼不纯度计算变体 MS-GINI,以在不泄露单个数据点或特征值的情况下计算特征重要性。
- 使用 MP-SPDZ 实现并基准测试该协议,确保在半诚实和恶意敌手模型下均具备正确性和安全性。
- 将协议结构化为子协议:π_MS-GINI 用于安全的基尼计算,π_FILTER-FS 用于特征排序与选择。
- 在共置的 Azure 虚拟机环境中执行协议,同时测量计算和通信开销。
实验结果
研究问题
- RQ1安全多方计算能否有效应用于机器学习中独立于模型训练的私有特征选择?
- RQ2在多方环境中,如何安全地计算基尼不纯度,以实现不暴露原始数据的私有特征评分?
- RQ3在真实世界的数据科学工作负载中,使用MPC进行私有特征选择的性能开销如何?
- RQ4使用MPC进行私有特征选择是否能在不损害隐私的前提下提升下游模型的准确性?
- RQ5安全模型(半诚实 vs. 恶意)如何影响协议的效率和可扩展性?
主要发现
- 所提出的基于MPC的特征选择协议在多个真实世界数据集(包括认知负荷检测、LSVT语音康复和速配约会)上,均提升了逻辑回归模型的准确性。
- 使用安全的 MS-GINI 方法进行特征选择,其准确性与传统的非私有特征选择技术(如皮尔逊相关系数和互信息)相当。
- 协议运行时间从几秒到约一小时不等,具体取决于数据集大小和安全模型,其中主动(恶意)设置的运行时间长于被动(半诚实)设置。
- 主要性能瓶颈是基尼计算中的矩阵乘法,其复杂度与样本数(m)、特征数(p)和所选特征数(k)成比例。
- 该协议成功保护了隐私:没有任何一方能够泄露关于原始特征值或所选特征的信息。
- 在 MP-SPDZ 中的实现证实了将私有特征选择集成到标准机器学习即服务(MLaaS)管道中的可行性,即使存在多个不可信服务器。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。