Skip to main content
QUICK REVIEW

[论文解读] Great Power, Great Responsibility: Recommendations for Reducing Energy for Training Language Models

J.C. McDonald, Baolin Li|arXiv (Cornell University)|May 19, 2022
Topic Modeling被引用 5
一句话总结

本文提出了一种针对大规模语言模型训练与推理的能效优化技术,重点聚焦于数据中心的功耗限制与能效感知调度。研究结果表明,功耗限制可将能耗降低15%,且对训练时间影响极小,为降低NLP工作负载的碳足迹提供了实用且非侵入性的方法,同时不影响模型准确率或性能。

ABSTRACT

The energy requirements of current natural language processing models continue to grow at a rapid, unsustainable pace. Recent works highlighting this problem conclude there is an urgent need for methods that reduce the energy needs of NLP and machine learning more broadly. In this article, we investigate techniques that can be used to reduce the energy consumption of common NLP applications. In particular, we focus on techniques to measure energy usage and different hardware and datacenter-oriented settings that can be tuned to reduce energy consumption for training and inference for language models. We characterize the impact of these settings on metrics such as computational performance and energy consumption through experiments conducted on a high performance computing system as well as popular cloud computing platforms. These techniques can lead to significant reduction in energy consumption when training language models or their use for inference. For example, power-capping, which limits the maximum power a GPU can consume, can enable a 15\% decrease in energy usage with marginal increase in overall computation time when training a transformer-based language model.

研究动机与目标

  • 解决NLP与机器学习领域中大规模语言模型日益增长的能耗问题。
  • 识别可实际应用且非侵入性的技术,以在不损害模型准确率的前提下降低训练与推理过程中的能耗。
  • 在NLP研究社区中提高对环境影响与能效问题的认识并推动实际行动。
  • 提供可测量、可针对硬件与数据中心配置的能耗降低方法,适用于AI工作负载。
  • 倡导在研究实践中整合能效考量,包括能耗报告与超参数调优的优化。

提出的方法

  • 在训练过程中对GPU施加功耗限制,以控制其最大功耗,从而降低能耗,且不改变模型权重或性能。
  • 采用能效感知调度,将实验安排在用电量较低的时段运行,此时冷却与电力需求也相应减少。
  • 在高性能计算集群与云平台两种环境中开展实验,以评估能耗与性能之间的权衡。
  • 通过实时监控测量并报告能耗数据,重点关注使用无碳电力来源,以最小化环境影响。
  • 评估硬件配置、数据中心PUE(电力使用效率)及系统负载对能效的影响。
  • 提出一种用于追踪与报告能耗的框架,以支持AI研究中的透明度与问责制。

实验结果

研究问题

  • RQ1如何有效应用功耗限制以减少Transformer架构语言模型训练期间的GPU能耗?
  • RQ2在NLP工作负载中应用功耗限制时,能耗节省与训练时间之间的权衡关系如何?
  • RQ3数据中心特性(如PUE与冷却效率)如何影响AI训练的总体能耗?
  • RQ4能效感知调度在不损害模型性能的前提下,能在多大程度上减少总能耗?
  • RQ5研究实践中需要哪些系统性变革,以减少NLP模型开发的环境足迹?

主要发现

  • 功耗限制可使基于Transformer的语言模型训练能耗降低最多15%,且训练时间仅略有增加。
  • 在不同功耗限制设置下,相同模型架构与超参数可生成完全相同的权重与性能表现,证实准确率不受影响。
  • 当功耗限制与能效感知调度结合使用时,节能效果显著增强,尤其在碳排放为零的电力来源支持的低峰用电时段效果更明显。
  • 本研究实验的总能耗为782千瓦时,其中760千瓦时由水力发电供电的HPC集群消耗,显著降低了碳排放。
  • 数据中心的电力效率(PUE)与冷却负载对总能耗有可测量的影响,凸显了在研究规划中关注基础设施能效的重要性。
  • 研究证明,通过系统级调优即可实现能耗降低,而无需修改模型架构或训练算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。