Skip to main content
QUICK REVIEW

[论文解读] ShadowSync: Performing Synchronization in the Background for Highly Scalable Distributed Training

Qinqing Zheng, Bor-Yiing Su|arXiv (Cornell University)|Mar 7, 2020
Stochastic Gradient Optimization Techniques参考文献 30被引用 4
一句话总结

ShadowSync 是一种分布式训练框架,通过在后台线程中执行同步操作,将同步与训练解耦,显著降低了同步开销,并实现了高频率同步而不影响训练吞吐量。该方法在大规模推荐系统中实现了卓越的模型质量与线性可扩展性,优于传统的前台同步方法。

ABSTRACT

Recommendation systems are often trained with a tremendous amount of data, and distributed training is the workhorse to shorten the training time. While the training throughput can be increased by simply adding more workers, it is also increasingly challenging to preserve the model quality. In this paper, we present \shadowsync, a distributed framework specifically tailored to modern scale recommendation system training. In contrast to previous works where synchronization happens as part of the training process, \shadowsync separates the synchronization from training and runs it in the background. Such isolation significantly reduces the synchronization overhead and increases the synchronization frequency, so that we are able to obtain both high throughput and excellent model quality when training at scale. The superiority of our procedure is confirmed by experiments on training deep neural networks for click-through-rate prediction tasks. Our framework is capable to express data parallelism and/or model parallelism, generic to host various types of synchronization algorithms, and readily applicable to large scale problems in other areas.

研究动机与目标

  • 解决在扩展大规模推荐系统的分布式训练时,维持高模型质量的挑战。
  • 克服由同步训练阶段导致的训练线程阻塞性能瓶颈。
  • 在统一框架中同时支持数据并行和模型并行,以应对大规模模型和数据集。
  • 同时实现高训练吞吐量和高同步频率,而这两者在传统系统中通常相互冲突。
  • 提供一种通用且可扩展的框架,支持多种同步算法,以适应不同的分布式训练工作负载。

提出的方法

  • 通过在专用后台‘影子’线程中运行同步操作,将同步与主训练线程解耦。
  • 使用影子线程独立执行参数平均和模型更新,与训练计算分离。
  • 在同一框架内同时支持数据并行(跨训练器)和模型并行(跨嵌入参数)。
  • 支持多种同步策略(例如 S-MA、S-BMUF、S-EASGD)同时且独立地应用于不同组件。
  • 通过每个训练器使用多个工作线程,集成训练器内部的 Hogwild 风格并行,以最大化内存带宽利用率。
  • 设计系统时对底层同步算法保持透明,支持各种方法的即插即用式集成。

实验结果

研究问题

  • RQ1将同步与训练分离是否能减少大规模分布式训练中的通信和计算瓶颈?
  • RQ2后台同步是否能在不降低训练吞吐量的前提下实现更高的同步频率?
  • RQ3与传统的前台同步相比,该框架在大规模推荐系统中能否维持或提升模型质量?
  • RQ4随着训练器数量和数据规模的增加,解耦同步模型的可扩展性如何?
  • RQ5该框架在保持高效率和低开销的前提下,能在多大程度上同时支持数据并行和模型并行?

主要发现

  • ShadowSync 实现了每秒有效参数更新(EPS)的线性扩展,且不受同步开销的限制。
  • 在 ShadowSync 下,S-MA 和 S-BMUF 变体的模型质量与它们的前台对应版本(FR-MA、FR-BMUF)相当或更优,尤其是在训练和评估的负对数似然(NE)方面。
  • 使用更大弹性参数 α 的 S-BMUF 比默认设置收敛更快且性能更优,验证了框架的设计灵活性。
  • 该框架支持高吞吐量训练,每个训练器使用 24 个工作线程时,EPS 增益达到饱和,这是由于内存带宽饱和所致。
  • ShadowSync 实现了高频同步——例如,在 24 个训练器下,S-MA 每分钟可实现 2.9 次同步——且不影响训练吞吐量。
  • 去中心化变体(S-BMUF、S-MA)与集中式 S-EASGD 表现相当,证明了影子同步在不同同步拓扑结构下均有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。