[论文解读] Optimizing Memory-Access Patterns for Deep Learning Accelerators
本文提出了一种基于全局多面体模型的优化框架,旨在减少在定制加速器上深度学习工作负载的内存访问次数。通过消除冗余的数据移动并一致地映射跨内存 bank 的张量,该方法在 AWS Inferentia 芯片上将片上和片外内存复制分别减少了最高达 76% 和 37%。
Deep learning (DL) workloads are moving towards accelerators for faster processing and lower cost. Modern DL accelerators are good at handling the large-scale multiply-accumulate operations that dominate DL workloads; however, it is challenging to make full use of the compute power of an accelerator since the data must be properly staged in a software-managed scratchpad memory. Failing to do so can result in significant performance loss. This paper proposes a systematic approach which leverages the polyhedral model to analyze all operators of a DL model together to minimize the number of memory accesses. Experiments show that our approach can substantially reduce the impact of memory accesses required by common neural-network models on a homegrown AWS machine-learning inference chip named Inferentia, which is available through Amazon EC2 Inf1 instances.
研究动机与目标
- 为解决深度学习加速器中因内存访问效率低下导致的性能瓶颈,特别是针对软件管理的临时存储(scratchpads)的场景。
- 克服现有编译器仅针对单个算子优化内存访问但忽略跨算子数据移动机会的局限性。
- 通过全局优化系统性地减少冗余内存复制,并最大化片上内存带宽利用率。
- 通过一致管理多个算子间的数据布局,实现领域专用加速器(如 AWS Inferentia)上深度学习模型的高效执行。
提出的方法
- 利用多面体模型将张量访问表示为仿射函数,从而实现对数据依赖关系和内存访问模式的正式分析。
- 通过仿射函数复合与索引空间映射识别并移除冗余的加载-存储对,实现数据移动消除。
- 使用反向仿射映射将中间张量的加载操作转换为源张量的加载操作,从而消除中间存储。
- 采用定点迭代方法基于数据依赖关系在算子间传播内存 bank 映射,确保 bank 分配的一致性。
- 将张量的外层维度映射到不同的内存 bank,内层维度映射到同一 bank 内的元素,以支持顺序访问并最大化并行性。
- 仅在连续算子之间存在冲突的 bank 映射需求时,才引入显式的内存复制。
实验结果
研究问题
- RQ1在多个算子之间进行全局内存访问模式优化,能否减少深度学习加速器中的冗余数据移动?
- RQ2多面体模型在支持领域专用加速器的跨算子内存访问优化方面有多大的有效性?
- RQ3与局部的、按算子的映射相比,全局内存 bank 映射在多大程度上能减少片上和片外内存复制?
- RQ4消除中间张量存储对真实世界深度学习模型的性能影响如何?
主要发现
- 所提出的方法在 Parallel WaveNet 中消除了 124 对加载-存储中的 123 对,将中间张量存储减少了 146 MB 中的 145 MB。
- 在 Parallel WaveNet 中,数据移动消除节省了 10% 的片上内存复制和 11% 的片外内存复制。
- 与局部映射相比,全局内存 bank 映射在 ResNet-50 中将片上数据复制减少了 76%,片外复制减少了 37%。
- 该方法通过最小化跨 bank 数据移动并保持算子间的数据局部性,显著提升了内存带宽利用率。
- 该优化在真实硬件上有效,已在可通过 EC2 Inf1 实例访问的 AWS Inferentia 芯片上得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。