[论文解读] A configurable accelerator for manycores: the Explicitly Many-Processor Approach
本文提出了一种新型处理器架构——显式多处理器方法(EMPA),通过监督层实现动态、用户可编程的核心协作。通过允许核心利用编译器提供的并行化提示,将任务外包给邻近核心,EMPA可将计算吞吐量提升数十倍,提高硬件效率,简化实时操作,并消除对复杂操作系统服务的依赖,同时通过显式、非隐藏的并行管理方式降低晶体管数量和功耗。
A new approach to designing processor accelerators is presented. A new computing model and a special kind of accelerator with dynamic (end-user programmable) architecture is suggested. The new model considers a processor, in which a newly introduced supervisor layer coordinates the job of the cores. The cores have the ability (based on the parallelization information provided by the compiler, and using the help of the supervisor) to outsource part of the job they received to some neighbouring core. The introduced changes essentially and advantageously modify the architecture and operation of the computing systems. The computing throughput drastically increases, the efficiency of the technological implementation (computing performance per logic gates) increases, the non-payload activity for using operating system services decreases, the real-time behavior changes advantageously, and connecting accelerators to the processor greatly simplifies. Here only some details of the architecture and operation of the processor are discussed, the rest is described elsewhere.
研究动机与目标
- 为应对单处理器性能增长停滞的问题,重新思考70年来沿用的冯·诺依曼单处理器模型。
- 克服当前多核系统在可配置性差、操作系统开销高和资源利用效率低方面的局限。
- 通过一种新型软硬件协同设计模型,实现在多核架构上单线程应用的高性能执行。
- 通过消除隐藏处理单元并减少对操作系统服务的依赖,简化处理器架构。
- 通过自然的原子执行模型,提升实时确定性并简化加速器集成。
提出的方法
- 引入监督层以协调核心协作,实现邻近核心之间的动态任务外包。
- 采用一种新执行模型,其中核心作为原子处理单元(准线程,QTs)运行,由硬件显式管理。
- 利用编译器生成的并行化信息指导核心协作,使父核心能够将子任务委派给辅助核心。
- 采用两种模式——FOR和SUMUP,其中辅助核心用于向量处理,通过动态分配优化核心利用率。
- 应用核心利用率效率指标(α_eff)和加速比(S_k),评估不同向量长度下的性能提升。
- 通过使QTs原子化且自包含,消除上下文切换和操作系统的干预,降低软件复杂度。
实验结果
研究问题
- RQ1一种显式管理多个核心的新处理器模型,是否能突破传统单处理器和多核设计的性能极限?
- RQ2如何在不依赖隐藏或推测性处理单元的前提下,实现核心协作的可编程化与高效化?
- RQ3显式多处理器方法在多大程度上可减少操作系统的开销,并提升嵌入式和高性能系统中的实时确定性?
- RQ4当核心被动态协调以处理大规模数据时,单线程应用可实现多大的性能提升?
- RQ5与传统多核系统相比,EMPA模型在简化加速器集成和降低硬件复杂度方面有何优势?
主要发现
- EMPA架构在数据并行工作负载(如向量求和操作)中,可将计算吞吐量提升至数十倍。
- 在SUMUP模式下,长向量的利用率效率(α_eff)可达1.0,表明辅助核心的使用接近最优。
- 加速比(S_k)在31个核心(1个父核心 + 30个辅助核心)时趋于饱和,且由于核心回收机制,即使在任意长的向量下性能增益仍能保持。
- 该方法减少了对操作系统的依赖,通过使QTs原子化和自包含,消除了上下文切换,简化了实时行为。
- 该架构消除了管理隐藏处理单元的冗余逻辑,降低了晶体管数量和功耗。
- 加速器可通过标准化接口轻松连接至EMPA处理器,因为处理器原生支持与外部电路进行数据和信号交换。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。