[论文解读] Robust Coreset Construction for Distributed Machine Learning
本文提出了一种用于分布式机器学习的鲁棒核心集构建算法,能够生成一个单一、可重用的核心集,支持多种监督与无监督学习问题(如 k-means、PCA、SVM 和神经网络),同时最小化通信开销。通过利用加权 k-means/中位数聚类中心,并在节点间分布核心集构建过程,该方法在多种模型上实现了可证明的近似保证,且数据传输量极少,经实验证实在真实世界数据集(包括 MNIST 和 HAR)上表现优异。
Coreset, which is a summary of the original dataset in the form of a small weighted set in the same sample space, provides a promising approach to enable machine learning over distributed data. Although viewed as a proxy of the original dataset, each coreset is only designed to approximate the cost function of a specific machine learning problem, and thus different coresets are often required to solve different machine learning problems, increasing the communication overhead. We resolve this dilemma by developing robust coreset construction algorithms that can support a variety of machine learning problems. Motivated by empirical evidence that suitably-weighted k-clustering centers provide a robust coreset, we harden the observation by establishing theoretical conditions under which the coreset provides a guaranteed approximation for a broad range of machine learning problems, and developing both centralized and distributed algorithms to generate coresets satisfying the conditions. The robustness of the proposed algorithms is verified through extensive experiments on diverse datasets with respect to both supervised and unsupervised learning problems.
研究动机与目标
- 解决因为每个学习任务构建特定问题核心集而导致的分布式机器学习中高通信成本问题。
- 开发一种统一的核心集构建框架,使用单一核心集支持广泛的机器学习问题,包括监督与无监督模型。
- 确保核心集在多种学习问题(如 k-means、PCA、SVM 和深度神经网络)上均具备理论近似保证。
- 设计高效且可扩展的集中式与分布式算法,适用于大规模高维数据集,同时保护数据隐私并最小化带宽使用。
- 在真实世界的边缘计算场景中,验证核心集在不同数据分布、模型复杂度和通信约束下的鲁棒性。
提出的方法
- 使用适当加权的 k-means 或 k-median 聚类中心作为核心摘要原语来构建核心集,基于其鲁棒性的实证证据。
- 建立理论条件,证明这些加权中心可形成 ϵ-核心集,从而为一大类学习问题保证有界的相对近似误差。
- 设计一种分布式核心集构建算法(DRCC),通过在节点间分配核心集大小和局部中心,实现准确率与通信成本之间的平衡。
- 提出一种通信高效的核⼼集构建协议(CDCC),使边缘节点能够以最少的数据传输量协作构建全局核心集。
- 应用利普希茨连续性界,将近似保证从基础问题(如 MEB)扩展到更复杂的模型,如 SVM 和神经网络。
- 使用蒙特卡洛评估方法,对相对近似误差界进行经验验证,确保其在所有数据集和模型上均保持在理论范围内。

实验结果
研究问题
- RQ1是否可以构建一个单一核心集,以支持分布式环境下的多种机器学习问题,而无需重新收集数据?
- RQ2何种理论条件可确保基于 k-means/中位数中心构建的核心集对多种学习问题提供可证明的近似?
- RQ3如何在分布式节点之间优化核心集大小与局部中心分配,以在不同数据分布和模型类型下保持鲁棒性?
- RQ4与使用完整数据集训练相比,所提出的核⼼集在复杂模型(如深度神经网络和 SVM)上的准确性保持程度如何?
- RQ5核心集大小与局部中心数量如何影响分布式核心集构建中的模型性能?其中存在何种权衡?
主要发现
- 所提出的核⼼集构建方法在 Fisher 的 Iris 数据集上实现了最大 0.0053 的相对近似误差(MEB,核心集大小为 20),远低于理论边界 ε = 0.1073。
- 在 MNIST 数据集上,核心集实现了 0.0024 的相对误差,而理论边界 ε = 10.74,表明实际误差显著低于最坏情况边界。
- 将局部中心数量(K)从 1 增加到 2 显著提升了模型性能,尤其在神经网络中表现明显,但对无监督模型而言,进一步增加带来的收益逐渐减少。
- 分布式核心集构建(DRCC)在核心集大小增加时,其模型质量优于基线方法,展现出强大的可扩展性与通信效率。
- 尽管仅传输了原始数据的极小部分,该核心集仍使 HAR 和 MNIST 上的深度神经网络训练准确率分别达到完整数据模型的 78.01% 和 87.01%。
- 所有数据集和模型上的近似误差理论边界均被一致地保持在上界内,证实了核心集构建在多种学习问题上的鲁棒性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。