[论文解读] Graph Partitioning via Parallel Submodular Approximation to Accelerate Distributed Machine Learning
该论文提出Parsa,一种用于图划分的并行子模近似算法,通过最小化机器间通信来加速分布式机器学习。通过将数据和参数放置建模为图划分问题,并利用高效的子模优化,Parsa将网络流量减少了90%,并在包含100亿个非零元素的大规模数据集CTRb上实现了1.6倍的训练加速。
Distributed computing excels at processing large scale data, but the communication cost for synchronizing the shared parameters may slow down the overall performance. Fortunately, the interactions between parameter and data in many problems are sparse, which admits efficient partition in order to reduce the communication overhead. In this paper, we formulate data placement as a graph partitioning problem. We propose a distributed partitioning algorithm. We give both theoretical guarantees and a highly efficient implementation. We also provide a highly efficient implementation of the algorithm and demonstrate its promising results on both text datasets and social networks. We show that the proposed algorithm leads to 1.6x speedup of a state-of-the-start distributed machine learning system by eliminating 90\% of the network communication.
研究动机与目标
- 解决由于跨机器频繁同步共享参数而导致的分布式机器学习通信瓶颈问题。
- 通过图划分优化数据和参数放置,减少大规模学习系统中的机器间通信开销。
- 设计一种可扩展、高效且理论基础坚实的划分算法,优于现有方法如METIS和PaToH。
- 通过最小化机器间数据移动,实现分布式推理的更快收敛和更低延迟。
- 在包含数十亿个非零元素的真实文本和社交网络数据集上展示实际有效性。
提出的方法
- 将数据和参数放置建模为顶点切割图划分问题,以最小化通信成本。
- 使用并行子模近似算法迭代地将顶点分配给各个分区,利用子模函数的性质获得近似保证。
- 采用双重链表数据结构实现O(k|E|)的时间复杂度,其中k为分区数,|E|为边数。
- 应用采样、智能初始化和并行化技术以提升划分质量和运行效率。
- 将Parsa与参数服务器框架集成,加速最先进的求解器(如DBPG)在ℓ₁-正则化逻辑回归中的性能。
- 采用最大τ延迟一致性模型,与实际分布式训练系统对齐,减少同步开销。
实验结果
研究问题
- RQ1并行子模近似算法是否能在分布式机器学习的图划分中同时实现理论保证和实际效率?
- RQ2在大规模数据集上,Parsa与现有划分工具METIS、PaToH和Zoltan相比,在通信成本和运行时间方面表现如何?
- RQ3Parsa在实际应用中能在多大程度上减少机器间通信并加速分布式训练?
- RQ4当机器数量和数据规模增加时,Parsa在稀疏真实图上的可扩展性如何,特别是在大规模场景下?
- RQ5在高度并行化和初始信息有限的情况下,Parsa能否保持高质量的划分结果?
主要发现
- 在CTRb数据集上,Parsa将ℓ₁-正则化逻辑回归的机器间通信从4.23 TB减少至0.32 TB,降幅达90%。
- 在16台机器上,Parsa将训练时间从1.43小时缩短至0.91小时,实现了1.6倍的加速。
- Parsa仅用4分钟就完成了CTRb数据集(100亿个非零元素)的划分,展现出极高的运行效率。
- 划分后,本地(机器内)通信占比从6%提升至92%,显著改善了数据局部性。
- 在文本和社交网络数据集上,Parsa在划分质量和执行时间方面均优于或匹配最先进的工具如METIS、PaToH和Zoltan。
- 即使在从4个工作节点扩展到64个工作节点时,Parsa仍能保持高质量划分,结果质量仅下降5%,得益于一致的初始化和稀疏尾部顶点冲突处理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。