[论文解读] The BaseJump Manycore Accelerator Network
BaseJump 多核加速器网络是一种面向 RISC-V 兼容多核系统的开源、基于网格的片上网络,通过分区全局地址空间模型实现高效的远程内存操作。其采用最少的硬件开销,支持远程加载、存储和原子交换操作,适用于散射/聚集工作负载,通过维序路由和基于信用的流量控制实现可扩展通信,性能优异。
The BaseJump Manycore Accelerator-Network is an open source mesh-based On-Chip-Network which is designed leveraging the Bespoke Silicon Group's 20+ years of experience in designing manycore architectures. It has been used in the 16nm 511-core RISC-V compatible Celerity chip Davidson et al. (2018), forming the basis of both a 1 GHz 496-core RISC-V manycore and a 10-core always-on low voltage complex. It was also used in the 180nm BSG Ten chip, which featured ten cores and a mesh that extends over off-chip links to an FPGA. To facilitate use by the open source community of the BaseJump Manycore network, we explain the ideas, protocols, interfaces and potential uses of the mesh network. We also show an example with source code that demonstrates how to integrate user designs into the mesh network.
研究动机与目标
- 为多核加速器提供一种可扩展的开源片上网络,实现最小的面积和能耗开销。
- 在分区全局地址空间模型下,支持高效的远程内存访问模式,如随机散射和聚集操作。
- 实现多样化加速器(从 RISC-V 核心到 DSP 和 eFPGA)无缝集成到统一的基于网格的通信架构中。
- 提供简单和高级两种集成模式:标准端点用于基本的加载/存储操作,低层网络感知设计用于流式 RPC 风格工作负载。
- 通过维序路由和单一分割带宽限制,分析并量化在均匀随机、转置和最近邻通信模式下的网络性能。
提出的方法
- 采用二维网格拓扑,结合维序路由和最小缓冲区,以减少面积和能耗。
- 使用单倍宽 32 位数据包格式,包含操作类型(加载、存储、交换)、源/目标坐标和数据载荷的头部字段。
- 通过基于信用的流量控制机制管理网络拥塞,确保请求和应答数据包的可靠传输。
- 通过 (X, Y, local_address) 地址寻址方式,在分区全局地址空间模型下支持远程内存操作,实现跨 Tile 的加载、存储和比较并交换。
- 提供标准端点模块,抽象网络复杂性,使执行简单远程内存访问的加速器更易使用。
- 通过直接网络接口设计支持高级流式工作负载,使加速器能够将传入请求作为流水线化的 RPC 流处理。
实验结果
研究问题
- RQ1如何设计一种低面积、低能耗的片上网络,以在多核系统中支持高性能远程内存操作?
- RQ2在均匀随机流量下,最小网格网络的性能极限是什么?其性能如何随网络规模扩展?
- RQ3在不同通信模式下,维序路由(DOR)与自适应算法(如 Valiant、ROMM)在平均分组延迟方面有何对比?
- RQ4哪些机制能够实现计算模型各异的加速器(尤其是需要流式或原子操作的)高效集成到共享网络架构中?
- RQ5在网格拓扑中,能否通过单一分割带宽和负载流量指标准确预测网络性能?
主要发现
- 在 16×16 网格中,网络在均匀随机流量下每 4 个周期可维持一次新消息注入,受限于 16 条链路的单一分割带宽,每条链路每周期最多可处理 4 条消息。
- 在均匀随机流量下,16×16 网格的平均往返延迟约为 48 个周期,当所有核心均跨单一分割发送消息时,仅出现约 3 倍的相对资源利用率不足。
- 维序路由(DOR)在转置通信模式下表现较差,但在最近邻通信中效率极高,仿真结果已证实此对比。
- 由于阻塞硬件极少且每周期可实现单字远程存储,网络在随机散射操作中表现出高吞吐量。
- 远程加载和比较并交换操作因需往返通信而延迟较长,但可通过数据局部性或跨多个 Tile 的并行化进行缓解。
- 网络性能受单一分割带宽限制:在 16×16 网格中,单一分割每周期最多可维持 32 次远程操作,限制了高并发工作负载的执行效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。