[论文解读] ConfuciuX: Autonomous Hardware Resource Assignment for DNN Accelerators using Reinforcement Learning
ConfuciuX 提出了一种基于强化学习的方法,可自主优化深度神经网络(DNN)加速器中的硬件资源分配(计算与内存),以实现最低延迟和能耗,该方法结合了 REINFORCE 算法与详细的性能成本模型,并通过遗传算法进行微调。其收敛速度相比其他优化技术快 4.7–24 倍。
DNN accelerators provide efficiency by leveraging reuse of activations/weights/outputs during the DNN computations to reduce data movement from DRAM to the chip. The reuse is captured by the accelerator's dataflow. While there has been significant prior work in exploring and comparing various dataflows, the strategy for assigning on-chip hardware resources (i.e., compute and memory) given a dataflow that can optimize for performance/energy while meeting platform constraints of area/power for DNN(s) of interest is still relatively unexplored. The design-space of choices for balancing compute and memory explodes combinatorially, as we show in this work (e.g., as large as O(10^(72)) choices for running \mobilenet), making it infeasible to do manual-tuning via exhaustive searches. It is also difficult to come up with a specific heuristic given that different DNNs and layer types exhibit different amounts of reuse. In this paper, we propose an autonomous strategy called ConfuciuX to find optimized HW resource assignments for a given model and dataflow style. ConfuciuX leverages a reinforcement learning method, REINFORCE, to guide the search process, leveraging a detailed HW performance cost model within the training loop to estimate rewards. We also augment the RL approach with a genetic algorithm for further fine-tuning. ConfuciuX demonstrates the highest sample-efficiency for training compared to other techniques such as Bayesian optimization, genetic algorithm, simulated annealing, and other RL methods. It converges to the optimized hardware configuration 4.7 to 24 times faster than alternate techniques.
研究动机与目标
- 解决 DNN 加速器中片上计算与内存分配的优化挑战,该问题对性能与能效至关重要,但目前研究尚不充分。
- 克服设计空间的组合爆炸问题(例如,MobileNet-V2 的设计空间规模约为 O(10^72)),使得穷举搜索不可行。
- 在平台资源约束下,自动化实现层序贯(LS)与层流水(LP)部署场景下的硬件资源分配过程。
- 相比贝叶斯优化、模拟退火及其他强化学习方法,提升设计空间探索中的样本效率。
- 实现硬件配置与数据流风格的联合探索,从而在固定数据流选择的基础上进一步提升性能。
提出的方法
- 采用 REINFORCE 强化学习算法,在庞大的硬件配置空间中进行全局搜索,利用详细的硬件性能成本模型估算奖励。
- 集成遗传算法(GA)在粗略解找到后进行局部微调,进一步优化最终配置。
- 将资源分配问题建模为离散且不规则的优化任务,其中动作对应于为每个 DNN 层分配处理单元(PE)和缓冲区。
- 基于端到端延迟与能耗的奖励函数,同时满足面积与功耗约束,引导强化学习策略向最优配置收敛。
- 支持层序贯(LS)与层流水(LP)两种部署模型,针对每种模型采用不同的资源分配策略。
- 利用预训练的性能成本模型模拟硬件行为,无需实际综合,从而实现 RL 代理的快速且可扩展的训练。
实验结果
研究问题
- RQ1强化学习能否有效探索 DNN 加速器中硬件资源分配的庞大且组合复杂的配置空间?
- RQ2在此背景下,基于 REINFORCE 的强化学习方法在样本效率上与贝叶斯优化、模拟退火及遗传算法等其他优化技术相比如何?
- RQ3联合探索硬件配置与数据流风格,相较于固定数据流选择,能在多大程度上进一步提升性能?
- RQ4结合强化学习进行全局搜索与遗传算法进行局部微调的混合方法,是否能优于单一方法?
- RQ5ConfuciuX 在不同 DNN 模型、数据流风格及平台约束(如物联网与云环境)下的表现如何?
主要发现
- ConfuciuX 在所有评估的优化技术中展现出最高的样本效率,其收敛速度比其他方法快 4.7 至 24 倍,可快速达到最优或近似最优配置。
- 基于 REINFORCE 的强化学习方法(Con’X(global))成功实现了硬件配置与数据流风格的同步探索,相比固定数据流基线,性能提升达 4% 至 69%。
- 在粗粒度强化学习优化之后,集成的遗传算法通过对其最佳配置进行局部微调,进一步将结果提升 7% 至 93%。
- 对于使用 128 个 PE 和 128 个缓冲区的 MobileNet-V2,设计空间包含约 O(10^72) 种可能配置,证实了穷举搜索的不可行性。
- 研究表明,硬件资源分配对加速器性能的影响可能超过数据流选择本身,这一结论得到了论文中引用的前期工作的支持。
- ConfuciuX 实现了在多种模型与部署场景(包括 LS 与 LP 模式)下的自动化、高效设计空间探索。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。