[论文解读] AXNet: ApproXimate computing using an end-to-end trainable neural network
AXNet 提出了一种端到端可训练的神经网络,通过使用哈达玛积融合的多任务学习,将近似器和预测器融合为单一架构,在保持高近似质量与能效的同时,相较于迭代训练方法,实现了50.7%更高的调用率和高达90%的训练时间减少。
Neural network based approximate computing is a universal architecture promising to gain tremendous energy-efficiency for many error resilient applications. To guarantee the approximation quality, existing works deploy two neural networks (NNs), e.g., an approximator and a predictor. The approximator provides the approximate results, while the predictor predicts whether the input data is safe to approximate with the given quality requirement. However, it is non-trivial and time-consuming to make these two neural network coordinate---they have different optimization objectives---by training them separately. This paper proposes a novel neural network structure---AXNet---to fuse two NNs to a holistic end-to-end trainable NN. Leveraging the philosophy of multi-task learning, AXNet can tremendously improve the invocation (proportion of safe-to-approximate samples) and reduce the approximation error. The training effort also decrease significantly. Experiment results show 50.7% more invocation and substantial cuts of training time when compared to existing neural network based approximate computing framework.
研究动机与目标
- 为解决现有近似计算框架中独立的近似器与预测器神经网络之间效率低下且协调不佳的问题。
- 通过将近似器与预测器融合为单一联合可训练网络,以减少训练时间与模型复杂度。
- 通过联合优化提升近似质量控制与调用率(可安全近似的输入比例)。
- 在NPU架构中实现高效部署,硬件开销最小化。
- 提供一种新颖且可扩展的融合机制,优于迭代训练与权重重用方法。
提出的方法
- AXNet 通过共享控制向量与隐藏层权重之间的哈达玛积操作,融合近似器与预测器,实现联合优化。
- 网络采用共享主干结构,其中预测头通过可学习控制向量与近似器隐藏层的逐元素相乘生成。
- 训练采用标准反向传播,损失函数为结合回归损失(用于近似精度)与分类损失(用于预测置信度)的多任务损失。
- 该融合机制实现参数共享且无架构约束,减少冗余与模型大小。
- 提出一种低成本的NPU部署策略,通过在处理单元中扩展近似子网单元,实现极小的硬件开销。
- 在Bessel、FFT、JPEG和Sobel等多个基准测试中评估方法的可扩展性与性能。
实验结果
研究问题
- RQ1统一的神经网络架构是否能比独立训练更有效地联合优化近似精度与安全近似输入的预测?
- RQ2与迭代训练相比,采用联合损失函数的端到端训练是否能减少训练时间并提高调用率?
- RQ3所提出的融合机制在多大程度上减少了模型参数量,并保持或提升了近似质量?
- RQ4AXNet 在不同神经网络拓扑结构与基准函数上的可扩展性如何?
- RQ5AXNet 是否能在实际NPU中实现高效部署,硬件修改极少,并带来显著的能效提升?
主要发现
- AXNet 的调用率比迭代训练方法高出50.7%,表明可安全近似的输入比例显著更大。
- 与迭代训练相比,训练时间最多减少90%,在Bessel和JPEG基准中分别实现了13.8倍与32倍的速度提升。
- 在JPEG基准中,AXNet 的参数量相比先前方法减少了60%,同时保持了相近的真实调用水平。
- 使用哈达玛积的融合技术在不同融合位置(第一层与第二层隐藏层)之间无显著性能差异,验证了其鲁棒性。
- 所有基准测试中均提升了能效,AXNet 因更高的调用率与更低的训练成本,优于迭代方法与单次训练方法。
- 所提出的NPU部署方式仅需对每个处理单元进行微小扩展以支持近似子网,硬件开销极低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。