[论文解读] DNNFuser: Generative Pre-Trained Transformer as a Generalized Mapper for Layer Fusion in DNN Accelerators
DNNFuser 提出了一种基于预训练 Transformer 的一次性、推理式映射器,用于自动化深度神经网络(DNN)加速器中的层融合优化,其性能与基于搜索的方法相当,同时速度提升 66 倍至 127 倍。该方法在未见过的硬件条件下具有良好的泛化能力,并可在新 DNN 工作负载上通过极少微调实现高效的迁移学习。
Dataflow/mapping decides the compute and energy efficiency of DNN accelerators. Many mappers have been proposed to tackle the intra-layer map-space. However, mappers for inter-layer map-space (aka layer-fusion map-space), have been rarely discussed. In this work, we propose a mapper, DNNFuser, specifically focusing on this layer-fusion map-space. While existing SOTA DNN mapping explorations rely on search-based mappers, this is the first work, to the best of our knowledge, to propose a one-shot inference-based mapper. We leverage Transformer as our DNN architecture to learn layer-fusion optimization as a sequence modeling problem. Further, the trained DNNFuser can generalize its knowledge and infer new solutions for unseen conditions. Within one inference pass, DNNFuser can infer solutions with compatible performance to the ones found by a highly optimized search-based mapper while being 66x-127x faster.
研究动机与目标
- 解决 DNN 加速器优化中尚属未充分探索的维度——层间映射空间(层融合)缺乏自动化映射器的问题。
- 克服现有基于搜索的映射器(如遗传算法、强化学习)计算成本过高的问题,这些方法需要大量探索才能获得最优映射。
- 实现无需迭代搜索的快速、一次性推理,以生成最优层融合策略,提升部署效率。
- 展示对未见过的硬件条件(如不同片上缓冲区大小)的泛化能力,以及在多样化 DNN 工作负载间的迁移学习能力。
- 通过将层融合建模为序列建模问题并采用 Transformer,建立 DNN 映射器设计的新范式。
提出的方法
- 将层融合映射建模为序列到序列(seq2seq)问题,其中输入为 DNN 模型的层配置和硬件约束,输出为融合后的层配置。
- 使用预训练的 Transformer 架构,学习从输入的 DNN 和硬件条件到最优层融合模式的映射关系。
- 在多样化 DNN 工作负载(如 VGG16、ResNet18)上进行训练,以学习高效层融合的通用知识。
- 支持基于推理的部署:模型训练完成后,仅需一次前向传播即可生成解决方案,无需搜索过程。
- 通过微调预训练的 DNNFuser 在新 DNN 工作负载(如 ResNet50、MobileNet-V2)上实现迁移学习,仅需原始训练周期的 10%。
- 将片上缓冲区大小作为条件输入,以实现对运行时硬件约束的动态适应。
实验结果
研究问题
- RQ1预训练的 Transformer 模型是否能有效学习并泛化到多样化 DNN 工作负载和硬件条件下的层融合策略?
- RQ2与最先进的基于搜索的映射器相比,DNNFuser 这类一次性推理式映射器在解决方案质量与速度方面表现如何?
- RQ3DNNFuser 对未见过的硬件配置(如不同片上缓冲区大小)的泛化能力有多强?
- RQ4在将 DNNFuser 应用于新 DNN 模型时,迁移学习是否能显著缩短训练时间并提升性能?
- RQ5在较长序列(如更深的网络 ResNet18)上,基于 Transformer 的方法是否优于基于 RNN 的模型(如 Seq2Seq)?
主要发现
- DNNFuser 在推理阶段的映射速度相比最先进的基于搜索的映射器提升 66 倍至 127 倍,同时保持相当的性能水平。
- 在 ResNet18 上,由于对长序列的处理能力更强,DNNFuser 的表现优于基于 RNN 的 Seq2Seq 基线模型,凸显了 Transformer 在序列建模中的优势。
- DNNFuser 具备对未见硬件条件的泛化能力:在未重新训练的情况下,可为新的片上缓冲区大小生成有效且高效的映射。
- 迁移学习使 DNNFuser 在新 DNN 工作负载(如 ResNet50、MobileNet-V2)上的微调仅需原始训练周期的 10%,性能达到甚至优于从零开始训练的结果。
- 预训练的通用映射器在 VGG16 上的性能与 G-Sampler 相当,在 ResNet18 上则表现更优,验证了其在多样化架构上的有效性。
- 模型学习到在深层网络中更积极地进行融合,原因在于激活张量尺寸较小;当激活张量形状或通道深度变化导致内存压力上升时,模型会主动同步到片外存储。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。