QUICK REVIEW
[论文解读] Power Consumption Variation over Activation Functions
Leon Derczynski|arXiv (Cornell University)|Jun 12, 2020
Parallel Computing and Optimization Techniques参考文献 9被引用 5
一句话总结
本文通过在CPU和GPU硬件上进行实测,研究了神经网络中不同激活函数对推理阶段功耗的影响。结果表明,ReLU及其变体等激活函数的功耗显著低于Sigmoid和Tanh等复杂函数,ReLU在平均情况下功耗降低高达50%,凸显了其在能效型深度学习中的关键优化潜力。
ABSTRACT
The power that machine learning models consume when making predictions can be affected by a model's architecture. This paper presents various estimates of power consumption for a range of different activation functions, a core factor in neural network model architecture design. Substantial differences in hardware performance exist between activation functions. This difference informs how power consumption in machine learning models can be reduced.
研究动机与目标
- 量化激活函数选择对深度神经网络推理阶段功耗的影响。
- 识别在不同硬件平台(CPU和GPU)上最节能的激活函数。
- 分析硬件特定瓶颈(如特殊功能单元SFUs)在激活计算过程中如何增加功耗。
- 提供实证证据表明,激活函数的复杂度与更高的能耗直接相关,尤其是在现代加速器上。
- 为模型设计提供指导,以在不牺牲性能的前提下降低能耗,特别是在资源受限的环境中。
提出的方法
- 在两个平台(MacBook Pro(i5-7360U CPU)和Intel Xeon E5-2660 CPU)上测量了功耗,使用PyTorch 1.5.0实现的28种激活函数。
- 在具有4096个隐藏单元的标准化5层前馈网络上执行推理,每次仅改变激活函数。
- 测量了从1到10^8的批量大小下的功耗,每种函数均多次测试以确保稳定性。
- 使用运行时间和平均功耗作为能耗的代理指标,通过功率×时间计算总能耗。
- 分析函数复杂度(如超越函数与分段线性函数)与实测功耗之间的关系,重点关注底层指令开销和硬件资源争用。
- 在不同硬件间对比结果,评估SFU等专用单元对性能和功耗的影响,特别是对Tanh等需要多次浮点运算的函数。
实验结果
研究问题
- RQ1在现代CPU和GPU上,激活函数的选择如何影响神经网络推理阶段的功耗?
- RQ2哪些激活函数最为节能,其高效性由哪些因素决定?
- RQ3硬件特定瓶颈(如SFU数量有限)在多大程度上放大了不同激活函数之间的功耗差异?
- RQ4激活函数的计算复杂度和指令级特性(如FPU使用率、微操作数)与实测功耗之间存在何种相关性?
- RQ5激活函数的简单架构选择是否能带来可测量的能耗降低,同时不损害模型精度?
主要发现
- ReLU及其变体(如ReLU6、LeakyReLU)始终表现出最低的功耗,ReLU在MacBook Pro上每推理一次的功耗低至5.820e-4 W。
- Sigmoid和Tanh等函数功耗显著更高——在Xeon上处理10^8个实例时,Tanh的功耗高达5.342e+02 W,主要由于其复杂的FPU依赖计算。
- 在大规模下,Tanh的功耗比ReLU高出100倍以上,分别为5.342e+02 W和5.199e+02 W(10^8个实例),显示出严重的能效低效。
- GPU上的硬件瓶颈(如V100每16个FP32核心仅配备一个SFU)导致复杂函数计算时线程空闲,从而增加功耗。
- Softplus和Softsign等函数因依赖超越运算(如exp、log)而表现出高功耗,尽管它们是可微且广泛使用的。
- 在Xeon E5-2660上,ReLU在10^8个实例下功耗为5.199e+02 W,而Tanh为5.342e+02 W,尽管计算负载相似,功耗仍高出2.7%,表明指令调度和FPU利用率存在效率问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。