[论文解读] SoC-Tuner: An Importance-guided Exploration Framework for DNN-targeting SoC Design
SoC-Tuner 是一种新颖的、基于重要性的探索框架,用于设计针对深度神经网络(DNN)优化的片上系统(SoC)架构。它结合基于重要性的剪枝、代表性采样以及基于信息的多目标优化,并通过完整的VLSI流程评估,高效识别出Pareto最优的SoC配置,在DNN基准测试中,其准确性和收敛速度均优于以往方法。
Designing a system-on-chip (SoC) for deep neural network (DNN) acceleration requires balancing multiple metrics such as latency, power, and area. However, most existing methods ignore the interactions among different SoC components and rely on inaccurate and error-prone evaluation tools, leading to inferior SoC design. In this paper, we present SoC-Tuner, a DNN-targeting exploration framework to find the Pareto optimal set of SoC configurations efficiently. Our framework constructs a thorough SoC design space of all components and divides the exploration into three phases. We propose an importance-based analysis to prune the design space, a sampling algorithm to select the most representative initialization points, and an information-guided multi-objective optimization method to balance multiple design metrics of SoC design. We validate our framework with the actual very-large-scale-integration (VLSI) flow on various DNN benchmarks and show that it outperforms previous methods. To the best of our knowledge, this is the first work to construct an exploration framework of SoCs for DNN acceleration.
研究动机与目标
- 为解决在DNN目标SoC设计中因依赖简化分析模型而导致的设计空间探索不准确和不完整的问题。
- 通过自动化识别高质量配置,减少SoC探索所需的时间和专业知识。
- 构建一个涵盖所有关键SoC组件(包括CPU、加速器、内存和互连)之间相互作用的综合性设计空间。
- 使用完整的VLSI流程而非近似模型,实现对延迟、功耗和面积的准确、硬件精确的评估。
- 实现对多维设计指标之间Pareto最优权衡空间的自动化、无偏见探索。
提出的方法
- 通过参数化所有主要SoC组件(包括CPU、加速器(如矩阵阵列)、内存层次结构和互连)来构建综合性设计空间。
- 采用基于重要性的分析方法,利用ICD算法识别并剪枝影响较小的设计参数,使设计空间缩小30.16%。
- 采用采样算法选择优化的代表性初始点,确保起始配置具有多样性与信息量。
- 采用基于信息的多目标优化策略,通过期望超体积改进(expected hypervolume improvement)平衡延迟、功耗和面积。
- 使用完整的VLSI流程对设计点进行准确评估,替代不准确的分析模型。
- 与Chipyard和Chisel集成,实现快速、参数化的硬件生成与RTL仿真。
实验结果
研究问题
- RQ1如何在保留找到Pareto最优配置能力的前提下,有效缩小针对DNN的SoC设计空间?
- RQ2与分析模型相比,使用完整的VLSI流程评估在多大程度上提升了设计空间探索的准确性?
- RQ3基于重要性的剪枝与代表性采样是否能显著加速多目标SoC探索中对Pareto最优集的收敛?
- RQ4在收敛速度和与真实Pareto前沿的接近程度方面,SoC-Tuner的优化策略与当前最先进方法相比如何?
- RQ5该框架是否可泛化至多种DNN工作负载,并保持高效率与高准确性?
主要发现
- 通过ICD算法进行基于重要性的剪枝,SoC-Tuner将设计空间缩小了30.16%,显著提升了探索效率。
- 与基线方法相比,该框架的平均到参考Pareto集合的距离(ADRS)更低,表明其对真实Pareto前沿的收敛性更优。
- 在延迟-面积和延迟-功耗空间中,如图4所示,SoC-Tuner学习得到的Pareto集合比其他方法更接近真实的Pareto最优集合。
- 先前工作中使用的简化分析模型所生成的Pareto集合与通过VLSI流程获得的实际度量值存在显著偏差,证明其不准确性。
- SoC-Tuner在多个DNN模型(包括ResNet50和基于Transformer的模型)上实现了最低的推理周期,优于其他探索方法。
- 由SoC-Tuner生成的最优SoC设计在面积开销最小的前提下实现了最高性能,如图7(b)所示的VLSI面积分解结果所证实。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。