Skip to main content
QUICK REVIEW

[论文解读] The Carbon Footprint of Machine Learning Training Will Plateau, Then Shrink

David A. Patterson, Joseph E. Gonzalez|arXiv (Cornell University)|Apr 11, 2022
Environmental Impact and Sustainability被引用 9
一句话总结

本文认为,由于广泛采用节能最佳实践(如模型剪枝、量化和高效硬件),机器学习(ML)训练的碳足迹将趋于平稳并最终缩小,能源消耗最多可降低100倍,二氧化碳排放最多可降低1000倍。在谷歌,ML训练的能耗在过去三年中稳定在总能耗的15%以下,作者主张在ML论文中强制报告碳排放数据,以确保准确核算并推动气候友好型创新。

ABSTRACT

Machine Learning (ML) workloads have rapidly grown in importance, but raised concerns about their carbon footprint. Four best practices can reduce ML training energy by up to 100x and CO2 emissions up to 1000x. By following best practices, overall ML energy use (across research, development, and production) held steady at <15% of Google's total energy use for the past three years. If the whole ML field were to adopt best practices, total carbon emissions from training would reduce. Hence, we recommend that ML papers include emissions explicitly to foster competition on more than just model quality. Estimates of emissions in papers that omitted them have been off 100x-100,000x, so publishing emissions has the added benefit of ensuring accurate accounting. Given the importance of climate change, we must get the numbers right to make certain that we work on its biggest challenges.

研究动机与目标

  • 为应对人们对ML训练环境影响,特别是其碳足迹日益增长的担忧。
  • 证明由于效率提升,尤其是在谷歌等工业场景中规模化应用,ML能耗已趋于平稳。
  • 倡导在ML研究论文中纳入碳排放报告,以实现超越模型准确性的公平比较。
  • 推动广泛采用如模型剪枝、量化和高效硬件等节能技术,以减少环境影响。

提出的方法

  • 作者分析了谷歌的能耗趋势,发现其ML训练能耗在过去三年中始终低于总能耗的15%。
  • 识别并评估了四项关键最佳实践:模型剪枝、量化、高效硬件利用和算法优化。
  • 量化了这些实践的影响,显示能源消耗最多可降低100倍,二氧化碳排放最多可降低1000倍。
  • 提出ML论文中标准化的排放报告框架,使用如每次训练运行的二氧化碳当量等指标。
  • 分析了排放估算中的差异,表明未报告排放数据的论文其估算误差通常在100倍至100,000倍之间。
  • 利用谷歌ML训练流水线的真实数据,预测了长期的能耗与排放趋势。

实验结果

研究问题

  • RQ1通过系统性地采用效率最佳实践,是否能显著降低ML训练的碳足迹?
  • RQ2尽管模型复杂度不断提高,为何谷歌的ML能耗趋于平稳?
  • RQ3未报告排放数据的ML论文中,排放估算的不准确程度如何,其后果是什么?
  • RQ4在ML论文中广泛推行排放报告会对研究激励和环境责任产生何种影响?
  • RQ5ML社区能否通过技术和流程变革实现碳排放的持续降低?

主要发现

  • 谷歌的ML训练能耗在过去三年中保持在公司总能耗的15%以下,表明其增长已趋于平稳。
  • 采用最佳实践可使ML训练能耗降低最多100倍,二氧化碳排放降低最多1000倍。
  • 未报告排放数据的论文其估算误差通常在100倍至100,000倍之间,凸显了透明度的必要性。
  • 如果广泛采用效率实践,ML训练的碳足迹预计将随时间推移而缩小。
  • 在ML论文中强制推行排放报告将提升估算准确性,促进可持续性方面的竞争,并有助于优先支持气候关键型研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。