QUICK REVIEW
[论文解读] Arrow: A RISC-V Vector Accelerator for Machine Learning Inference
Imad Al Assir, Mohamad El Iskandarani|arXiv (Cornell University)|Jul 15, 2021
一句话总结
Arrow 是一种面向边缘机器学习推理的可配置 RISC-V 向量加速器,实现了 RISC-V v0.9 向量 ISA 的子集。在基于 FPGA 的基准测试中,其相对于标量 RISC-V 处理器实现了 2–78× 的加速比和 20–99% 的能耗降低,展现出针对数据并行机器学习工作负载的出色性能与能效表现。
ABSTRACT
In this paper we present Arrow, a configurable hardware accelerator architecture that implements a subset of the RISC-V v0.9 vector ISA extension aimed at edge machine learning inference. Our experimental results show that an Arrow co-processor can execute a suite of vector and matrix benchmarks fundamental to machine learning inference 2 - 78x faster than a scalar RISC processor while consuming 20% - 99% less energy when implemented in a Xilinx XC7A200T-1SBG484C FPGA.
研究动机与目标
- 应对边缘机器学习推理领域对高效、领域专用加速器日益增长的需求。
- 利用 RISC-V 向量 ISA(v0.9 版本)实现可定制、高吞吐量的处理能力,以支持数据并行工作负载。
- 设计一种硬件加速器,使其在资源受限的边缘设备上实现高性能与低能耗。
- 通过 FPGA 原型设计,对代表性机器学习推理核的性能与能效进行评估。
- 证明 RISC-V 向量扩展在实际、高效边缘人工智能加速中的可行性。
提出的方法
- 基于 RISC-V v0.9 向量 ISA 扩展,实现一种可配置的向量加速器。
- 设计具有多个向量通道和分体式向量寄存器文件的流水线数据通路,以支持宽范围的数据并行操作。
- 集成支持跨步内存访问的向量加载/存储单元,以提升数据局部性并减少指针管理开销。
- 采用自定义内存接口与片上块 RAM,实现高效的数据传输与低延迟访问。
- 实现向量长度与配置寄存器,以支持运行时灵活性与动态向量大小自适应。
- 在 Xilinx XC7A200T FPGA 上部署设计,使用真实的机器学习推理核进行性能与能效评估。
实验结果
研究问题
- RQ1在机器学习推理工作负载中,RISC-V 向量加速器相较于标量 RISC-V 处理器在性能与能效方面表现如何?
- RQ2通过向量化技术利用数据级并行性,在边缘人工智能应用中可实现多大的性能与能效提升?
- RQ3不同数据大小配置如何影响 Arrow 加速器上向量化内核的加速比与能效表现?
- RQ4在 2D 卷积与矩阵最大池化等复杂机器学习内核中,向量化的主要性能瓶颈是什么?
- RQ5向量化在内存密集型与计算密集型机器学习内核中,能在多大程度上减少执行时间与能耗?
主要发现
- 在向量与矩阵基准测试中,Arrow 相较于标量 RISC-V 处理器实现了 2–78× 的加速比,最大加速比出现在大尺寸数据配置下。
- 矩阵乘法最高实现 78× 加速比,而向量加法与乘法的加速比为 25–78×,具体取决于数据大小。
- 尽管采用了优化的向量归约技术,2D 卷积的加速比仅为 1.4–1.9×,主要由于标量指针运算带来的高开销。
- 向量基准的能耗降低了 96–99%,矩阵基准降低了 80–99%,2D 卷积降低了 20–43%,主要归因于执行时间的显著缩短。
- 性能随向量大小增加而提升,因为向量设置开销(如设置向量长度)对长向量的影响更小。
- 结果表明,通过跨步向量操作等手段进一步优化内存访问模式,可显著提升不规则内核(如 2D 卷积与矩阵最大池化)的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。