Skip to main content
QUICK REVIEW

[论文解读] Optimizing Routerless Network-on-Chip Designs: An Innovative Learning-Based Framework

Ting-Ru Lin, Drew Penney|arXiv (Cornell University)|May 10, 2019
Interconnection Networks and Systems被引用 10
一句话总结

本文提出了一种深度强化学习(DRL)框架,通过在设计约束下学习近似最优的环路布局,优化无路由器网络-on-芯片(NoC)设计。该框架结合蒙特卡洛树搜索(MCTS)与多线程深度神经网络,实现的吞吐量比传统网格NoC提高3.25倍,延迟降低1.6倍,功耗减少5倍,在关键指标上优于当前最先进的无路由器NoC设计。

ABSTRACT

Machine learning applied to architecture design presents a promising opportunity with broad applications. Recent deep reinforcement learning (DRL) techniques, in particular, enable efficient exploration in vast design spaces where conventional design strategies may be inadequate. This paper proposes a novel deep reinforcement framework, taking routerless networks-on-chip (NoC) as an evaluation case study. The new framework successfully resolves problems with prior design approaches being either unreliable due to random searches or inflexible due to severe design space restrictions. The framework learns (near-)optimal loop placement for routerless NoCs with various design constraints. A deep neural network is developed using parallel threads that efficiently explore the immense routerless NoC design space with a Monte Carlo search tree. Experimental results show that, compared with conventional mesh, the proposed deep reinforcement learning (DRL) routerless design achieves a 3.25x increase in throughput, 1.6x reduction in packet latency, and 5x reduction in power. Compared with the state-of-the-art routerless NoC, DRL achieves a 1.47x increase in throughput, 1.18x reduction in packet latency, and 1.14x reduction in average hop count albeit with slightly more power overhead.

研究动机与目标

  • 为解决现有无路由器NoC设计方法的局限性,这些方法或因随机搜索而不可靠,或因结构约束僵化而缺乏灵活性。
  • 实现对超过10^12种配置的无路由器NoC设计空间的高效、约束感知探索。
  • 开发一种可扩展的、基于学习的框架,在多种设计约束下保证完全连接且高性能的NoC拓扑。
  • 通过周期精确的仿真和真实NoC工作负载的电路级评估,验证框架的有效性。
  • 建立一种可泛化的通用方法,适用于NoC和计算机体系结构中的其他约束设计问题。

提出的方法

  • 该框架采用双头结构的深度Q网络(DQN),以学习设计空间中动作选择的策略函数与价值函数。
  • 使用蒙特卡洛树搜索(MCTS)通过并行探索有前景的设计配置,生成高质量的训练数据。
  • 采用多线程训练架构,加速MCTS的滚动(rollouts),并实现对庞大无路由器NoC设计空间的高效探索。
  • 在动作采样过程中强制执行设计约束,如布线资源限制、连通性要求和三维距离边界,以确保解的可行性。
  • 利用从MCTS滚动中收集的自监督经验,端到端训练深度神经网络,使系统能够学习最优环路布局策略。
  • 通过周期精确的架构级仿真和4x4至10x10 NoC配置的电路级实现,对框架进行了验证。

实验结果

研究问题

  • RQ1深度强化学习框架能否在严格设计约束下,有效探索无路由器NoC的巨大设计空间?
  • RQ2与传统网格NoC相比,所提出的DRL框架在吞吐量、延迟和能效方面表现如何?
  • RQ3该框架在性能和可扩展性方面,相较于现有无路由器NoC设计(如REC和IMR)的优越程度如何?
  • RQ4该框架能否泛化到其他涉及复杂约束的NoC设计问题,如3D NoC或小芯片互连?
  • RQ5与随机搜索或启发式搜索相比,MCTS与深度学习的结合如何提升收敛速度和解的质量?

主要发现

  • 所提出的基于DRL的无路由器NoC相比传统网格NoC,吞吐量提升了3.25倍。
  • 与传统网格NoC相比,分组延迟降低了1.6倍,显著提升了实时性能。
  • 与传统网格NoC相比,功耗降低了5倍,展现出优异的能效表现。
  • 与最先进的REC无路由器NoC相比,DRL设计实现了1.47倍更高的吞吐量和1.18倍更低的分组延迟。
  • 与REC相比,平均跳数减少了1.14倍,表明通信效率更高。
  • 在从4x4扩展到10x10 NoC时,REC的吞吐量退化达31.6%,而DRL仅退化4.7%,显示出卓越的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。