[论文解读] Learning Privately over Distributed Features: An ADMM Sharing Approach
提出一个用于在垂直划分(分布式)特征上的经验风险最小化的 ADMM 共享框架,通过仅传输每个样本的单个值来实现隐私保护,并提供一个差分隐私变体。
Distributed machine learning has been widely studied in order to handle exploding amount of data. In this paper, we study an important yet less visited distributed learning problem where features are inherently distributed or vertically partitioned among multiple parties, and sharing of raw data or model parameters among parties is prohibited due to privacy concerns. We propose an ADMM sharing framework to approach risk minimization over distributed features, where each party only needs to share a single value for each sample in the training process, thus minimizing the data leakage risk. We establish convergence and iteration complexity results for the proposed parallel ADMM algorithm under non-convex loss. We further introduce a novel differentially private ADMM sharing algorithm and bound the privacy guarantee with carefully designed noise perturbation. The experiments based on a prototype system shows that the proposed ADMM algorithms converge efficiently in a robust fashion, demonstrating advantage over gradient based methods especially for data set with high dimensional feature spaces.
研究动机与目标
- 在特征本质上分布在各方且由于隐私原因不能共享原始数据时,激励学习。
- 开发一个基于 ADMM 的算法,在垂直分割数据的同时最小化经验风险,并在共享信息最少的前提下。
- 建立在非凸损失下的并行 ADMM 共享的收敛性保证,并提供一个差分隐私版本。
- 提供实证证据,表明该方法在高维特征数据集上的表现优于基于梯度的方法。
提出的方法
- 使用一个辅助变量 z 将分布式特征下的经验风险最小化重新表述为一个约束问题。
- 使用并行 ADMM 方案,其中每个参与方更新其本地变量 x_m,中心节点更新 z 和对偶变量 y。
- 每个参与方在每次迭代中仅共享一个数值,降低数据泄露风险。
- 对非凸损失下的并行 ADMM 进行收敛性和迭代复杂度分析,扩展了先前的 Gauss-Seidel 结果。
- 通过在共享信息中加入高斯噪声来实现一个差分隐私版本的 ADMM 共享,以达到 (ε,δ)-DP。
- 给出基于 Lyapunov 的收敛分析,并推导基于敏感性的噪声尺度以保证 DP。
实验结果
研究问题
- RQ1 ADMM 基于方法能否在不共享原始特征或本地模型的情况下解决垂直划分数据的 ERM?
- RQ2 在非凸损失设定下,可以为并行 ADMM 建立哪些收敛性和迭代复杂度保证?
- RQ3 如何将差分隐私整合到 ADMM 共享中,以保护中间通信而不致严重影响性能?
- RQ4 在高维特征空间中,ADMM 共享方法如何与基于梯度的方法相比?
主要发现
- 在对非凸损失的温和假设下,并行 ADMM 共享算法收敛到驻点解。
- 该方法通过 Lyapunov 函数表征收敛性,需有限迭代次数即可达到 ε-精确解。
- 一个差分隐私版本的 ADMM 共享在每次迭代和跨越 T 轮次使用高斯噪声来保证 ε,δ-差分隐私。
- 实验表明,ADMM 共享算法收敛高效且鲁棒,尤其在具有大特征空间的数据集上,并且在高维 setting 下可能优于基于梯度的方法。
- 差分隐私在中等扰动下也能维持,不会破坏收敛,提高隐私性,同时不过度牺牲预测准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。