Skip to main content
QUICK REVIEW

[论文解读] Pipeline Parallelism for Inference on Heterogeneous Edge Computing

Yang Hu, Connor Imes|arXiv (Cornell University)|Oct 28, 2021
Advanced Neural Network Applications参考文献 35被引用 11
一句话总结

EdgePipe 是一种分布式推理框架,采用基于动态规划的流水线并行技术,在异构边缘设备上加速大规模视觉变换器模型的推理,且不损失精度。通过在计算能力、内存和网络带宽各异的设备间最优划分模型,该框架在16台设备的集群上实现了最高达11.88倍的吞吐量加速。

ABSTRACT

Deep neural networks with large model sizes achieve state-of-the-art results for tasks in computer vision (CV) and natural language processing (NLP). However, these large-scale models are too compute- or memory-intensive for resource-constrained edge devices. Prior works on parallel and distributed execution primarily focus on training -- rather than inference -- using homogeneous accelerators in data centers. We propose EdgePipe, a distributed framework for edge systems that uses pipeline parallelism to both speed up inference and enable running larger (and more accurate) models that otherwise cannot fit on single edge devices. EdgePipe achieves these results by using an optimal partition strategy that considers heterogeneity in compute, memory, and network bandwidth. Our empirical evaluation demonstrates that EdgePipe achieves $10.59 imes$ and $11.88 imes$ speedup using 16 edge devices for the ViT-Large and ViT-Huge models, respectively, with no accuracy loss. Similarly, EdgePipe improves ViT-Huge throughput by $3.93 imes$ over a 4-node baseline using 16 edge devices, which independently cannot fit the model in memory. Finally, we show up to $4.16 imes$ throughput improvement over the state-of-the-art PipeDream when using a heterogeneous set of devices.

研究动机与目标

  • 解决在资源受限、异构的边缘设备上部署大型、高精度视觉变换器模型(如 ViT-Large、ViT-Huge)的挑战,这些设备的内存无法容纳完整模型。
  • 克服现有流水线并行框架的局限性,这些框架专为同构数据中心设计,未针对边缘环境中计算、内存和网络资源异构的特性进行优化。
  • 开发一种最优划分策略,在异构边缘设备之间均衡负载,以最大化推理吞吐量,同时保持模型精度。
  • 在真实边缘测试环境中验证流水线并行技术的有效性,包括单个设备无法存储完整模型的场景。

提出的方法

  • 将大型视觉变换器模型划分为多个阶段,采用流水线并行技术,每个阶段分配给不同的边缘设备。
  • 使用动态规划(DP)算法确定最优的划分映射,以考虑设备在计算、内存和网络带宽等方面的异构能力。
  • 对微批次处理进行建模,以实现计算与通信的重叠,提升流水线效率。
  • 实现通信优化的数据流,每个工作节点仅向下一阶段发送输出,避免集体同步。
  • 与模型压缩技术(如 DeiT)集成,进一步提升性能,展示两者之间的互补优势。
  • 在真实边缘测试平台上进行评估,使用多种边缘设备(如 MinnowBoard、RCC-VE Network Boards),以验证在真实环境下的性能表现。

实验结果

研究问题

  • RQ1在异构边缘设备上,流水线并行技术能否有效应用于大规模视觉变换器模型的推理,且不损失精度?
  • RQ2在边缘系统中存在计算、内存和网络资源异构的情况下,流水线并行的最优划分策略是什么?
  • RQ3在异构边缘环境中,EdgePipe 的性能与当前最先进的框架(如 PipeDream 和 GPipe)相比如何?
  • RQ4流水线并行与模型压缩技术结合,能在多大程度上进一步提升边缘推理的吞吐量?
  • RQ5EdgePipe 是否能够支持那些大到无法存储在单个边缘设备内存中的模型的推理?

主要发现

  • 在16台设备的同构集群上,EdgePipe 分别实现了 ViT-Large 和 ViT-Huge 模型 10.59× 和 11.88× 的吞吐量加速,且无精度损失。
  • 在4台设备的基础配置中,单个设备无法容纳 ViT-Huge 模型,EdgePipe 通过使用16台设备将吞吐量提升了3.93倍。
  • 在使用异构边缘设备集的情况下,EdgePipe 的吞吐量最高比 PipeDream 提高4.16倍。
  • 压缩模型(如 DeiT-Small、DeiT-Tiny)在 EdgePipe 上表现出更优的可扩展性,16台设备下最高达到每秒17.23张图像的推理速度。
  • 基于动态规划的划分策略能有效平衡异构设备间的负载,实现高效的流水线执行。
  • 流水线并行与模型压缩具有互补性:即使在模型压缩后,EdgePipe 仍能保持加速效果,表明两种技术之间存在协同增效作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。