Skip to main content
QUICK REVIEW

[论文解读] On the Viability of using LLMs for SW/HW Co-Design: An Example in Designing CiM DNN Accelerators

Zheyu Yan, Yifan Qin|arXiv (Cornell University)|Jun 12, 2023
Natural Language Processing Techniques被引用 4
一句话总结

本文提出 LCDA,这是首个将大型语言模型(LLMs)用作优化器来实现深度神经网络(DNN)加速器的软硬件协同设计(SW/HW co-design)的框架,特别针对计算内存(CiM)架构。通过利用预训练的 LLM 来规避神经架构搜索中的‘冷启动’问题,LCDA 在保持相当的准确率和能效的前提下,相比最先进方法实现了 25 倍的速度提升。

ABSTRACT

Deep Neural Networks (DNNs) have demonstrated impressive performance across a wide range of tasks. However, deploying DNNs on edge devices poses significant challenges due to stringent power and computational budgets. An effective solution to this issue is software-hardware (SW-HW) co-design, which allows for the tailored creation of DNN models and hardware architectures that optimally utilize available resources. However, SW-HW co-design traditionally suffers from slow optimization speeds because their optimizers do not make use of heuristic knowledge, also known as the ``cold start'' problem. In this study, we present a novel approach that leverages Large Language Models (LLMs) to address this issue. By utilizing the abundant knowledge of pre-trained LLMs in the co-design optimization process, we effectively bypass the cold start problem, substantially accelerating the design process. The proposed method achieves a significant speedup of 25x. This advancement paves the way for the rapid and efficient deployment of DNNs on edge devices.

研究动机与目标

  • 解决软硬件协同设计中的‘冷启动’问题,即优化器从随机猜测开始且缺乏启发式知识。
  • 探索使用预训练 LLM 作为智能优化器以加速寻找最优 DNN 与硬件协同设计方案的可行性。
  • 证明 LLM 可通过利用其对深度学习和硬件设计的广泛知识,有效提出高质量的 DNN 与 CiM 加速器设计方案。
  • 识别现成 LLM 在处理 CiM 加速器领域特定约束(如卷积核大小对延迟和效率的影响)方面的局限性。
  • 为未来可解释的神经架构搜索、微调的开源 LLM 以及自动化设计工具集成铺平道路。

提出的方法

  • 在软硬件协同设计的神经架构搜索流程中,集成一个预训练的 LLM(GPT-4)作为控制器。
  • 使用精心设计的提示词引导 LLM 生成 DNN 架构及相应的 CiM 加速器配置。
  • 使用模拟器(NeuroSIM)评估候选设计方案,以测量准确率、延迟和能耗。
  • 在搜索速度和设计质量方面,将 LCDA 的性能与最先进方法 NACIM 进行对比。
  • 通过禁用任务特定提示词进行消融研究,以隔离领域感知提示词对优化质量的影响。
  • 分析失败案例,识别 LLM 中存在的领域特定误解,如对卷积核大小和硬件利用率的错误假设。

实验结果

研究问题

  • RQ1预训练的 LLM 是否能有效作为软硬件协同设计中的优化器,从而规避‘冷启动’问题?
  • RQ2与基于强化学习或遗传算法的方法相比,基于 LLM 的协同设计在速度和设计质量方面表现如何?
  • RQ3在处理 CiM 加速器协同设计时,通用 LLM(如 GPT-4)存在哪些局限性,特别是涉及硬件特定约束时?
  • RQ4任务特定提示词如何影响 LLM 所提出设计方案的质量与效率?
  • RQ5LLM 生成的设计错误对未来协同设计框架有何影响,以及如何加以缓解?

主要发现

  • LCDA 在寻找最优 DNN 与 CiM 加速器协同设计方案方面,相比最先进方法 NACIM 实现了 25 倍的速度提升。
  • 尽管速度大幅提升,LCDA 的设计方案在准确率-延迟权衡上并未持续优于 NACIM,仅在帕累托前沿左上角出现一个异常点。
  • LLM 的表现受到错误泛化的影响——例如,持续增大卷积核大小以提升准确率——导致因器件差异效应而产生次优设计。
  • 消融研究显示,若无任务特定提示词,LLM(LCDA-naive)无法生成高效设计,凸显了领域感知提示词的必要性。
  • LLM 对硬件效率存在根本性误解:5×5 的卷积核可能导致交叉条带利用率低下并增加延迟,而 LLM 未能捕捉到这一细微差别。
  • 本研究强调了对领域特定数据进行微调 LLM 的必要性,因为现成模型缺乏实现最优 CiM 加速器协同设计所需的必要知识。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。