[论文解读] Coresets for Vertical Federated Learning: Regularized Linear Regression and $K$-Means Clustering
本文提出了一种用于通信高效垂直联邦学习(VFL)的统一核心集构建框架,实现了正则化线性回归和K均值聚类的次线性通信复杂度。通过利用分布式重要性采样和鲁棒核心集理论,该方法在温和条件下实现了ε-近似解,且核心集大小为o(n),显著降低了通信开销,同时保持了模型质量。
Vertical federated learning (VFL), where data features are stored in multiple parties distributively, is an important area in machine learning. However, the communication complexity for VFL is typically very high. In this paper, we propose a unified framework by constructing coresets in a distributed fashion for communication-efficient VFL. We study two important learning tasks in the VFL setting: regularized linear regression and $k$-means clustering, and apply our coreset framework to both problems. We theoretically show that using coresets can drastically alleviate the communication complexity, while nearly maintain the solution quality. Numerical experiments are conducted to corroborate our theoretical findings.
研究动机与目标
- 解决垂直联邦学习(VFL)中各方持有相同数据不同特征子集所导致的高通信复杂度问题。
- 开发一种可扩展的、通信高效的VFL训练框架,同时保持高模型准确率。
- 设计一种适用于VFL环境中正则化线性回归与K均值聚类的统一核心集构建方法。
- 在核心集大小相对于数据集规模n呈次线性增长(即o(n))的前提下,实现ε-近似解,显著降低通信成本。
- 通过鲁棒核心集采样避免原始数据传输,同时在温和条件下保持解的质量。
提出的方法
- 通过分布式重要性采样构建核心集,其中采样概率基于各参与方向的本地梯度和特征范数计算得出。
- 采用鲁棒核心集框架,在温和假设下为两类学习任务均提供(β, ε)-近似保证。
- 应用核心集文献中的理论边界,推导出样本大小m对维度d、k、ε、β及置信度δ的依赖关系。
- 设计一种通信高效的协议,各参与方仅计算本地统计量,并传输与核心集相关的权重和索引。
- 利用伪维数和函数空间分析,对核心集构建过程中的近似误差进行边界控制。
- 通过理论框架中对g_i和cG项的有界性控制,确保核心集大小保持在o(n)。
实验结果
研究问题
- RQ1能否在垂直联邦学习中以分布式、通信高效的方式构建核心集?
- RQ2该核心集框架能否在VFL中实现正则化线性回归的ε-近似解,且通信复杂度为次线性?
- RQ3该核心集框架能否扩展至VFL中的K均值聚类,并实现相当的通信节省?
- RQ4核心集大小如何随模型复杂度(d, k)、近似误差ε和置信度δ变化?
- RQ5在相同通信预算下,基于核心集的方法是否在解的质量上优于均匀采样?
主要发现
- 所提出的框架在核心集大小为O(d⁴ / (ε²β²T²) · (d² + log(1/δ)))时,可实现正则化线性回归的ε-近似解,且该大小与n无关。
- 对于K均值聚类,核心集大小为O(α²k⁴ / (ε²β²) · (dk + log(1/δ))),同样为n的次线性函数,且不依赖于数据集规模。
- 通信复杂度降低至O(mT),其中m为核心集大小,实现了相对于n的次线性通信。
- 数值实验表明,该核心集方法在显著降低通信开销的同时,保持了解的质量与全数据训练相当。
- 与均匀采样相比,该核心集方法在相同或更低的通信成本下实现了更优的模型性能。
- 理论分析证明,该核心集构建在温和条件下具有鲁棒性,以高概率(1−δ)维持近似保证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。