Skip to main content
QUICK REVIEW

[论文解读] How to estimate carbon footprint when training deep learning models? A guide and review

Lucia Bouza Heguerte, Aurélie Bugeau|arXiv (Cornell University)|Jun 14, 2023
Green IT and Sustainability被引用 4
一句话总结

本文全面介绍了七种用于估算深度学习模型训练期间碳足迹的工具,并进行了对比分析。该研究评估了其在从个人电脑到机构服务器等多种基础设施上的准确性、能耗和易用性,表明仅测量部分训练周期并外推的方法可获得可靠结果,同时强调了根据具体使用场景选择合适的工具和基础设施扩展策略的重要性。

ABSTRACT

Machine learning and deep learning models have become essential in the recent fast development of artificial intelligence in many sectors of the society. It is now widely acknowledge that the development of these models has an environmental cost that has been analyzed in many studies. Several online and software tools have been developed to track energy consumption while training machine learning models. In this paper, we propose a comprehensive introduction and comparison of these tools for AI practitioners wishing to start estimating the environmental impact of their work. We review the specific vocabulary, the technical requirements for each tool. We compare the energy consumption estimated by each tool on two deep neural networks for image processing and on different types of servers. From these experiments, we provide some advice for better choosing the right tool and infrastructure.

研究动机与目标

  • 为应对训练深度学习模型带来的日益严重的环境影响,尤其是大语言模型可能排放数百吨二氧化碳当量(CO2eq)的排放问题。
  • 帮助AI从业者克服因不熟悉硬件术语和工具选择而带来的能源消耗与碳排放估算挑战。
  • 评估并对比七种现有工具(如CodeCarbon、Eco2AI、Green-Algorithms)在模型训练过程中对动态能耗的测量能力。
  • 基于使用功率计的实际测试,为工具选择、基础设施使用和测量策略提供实用建议。
  • 指出现有局限性,如未计入部署阶段和隐含能耗的总排放量低估问题,以及亟需更完善的生命周期影响评估。

提出的方法

  • 本研究评估了七种碳足迹估算工具:Green-Algorithms、CodeCarbon、Eco2AI、CarbonTracker、Experiment-Impact-Tracker、MLCO2和Cumulator。
  • 使用物理功率计在五种真实基础设施上测量能耗:Labri服务器、MAP5服务器、Grid5000集群、个人电脑及Google Colab。
  • 采用两种图像处理任务:MNIST数字分类(短时,约1分钟)和基于DNCNN的ImageNet验证数据图像去噪(长时,约2小时)。
  • 通过将工具估算结果与实际功率计测量值对比,评估其估算准确性,并量化各工具自身的能耗。
  • 通过实验分析关键超参数(如批量大小、数据加载方式、检查点设置和训练周期数)的影响,以指导外推策略。
  • 区分过程级测量与机器级测量,并评估各工具的使用率因子和默认值设置差异。

实验结果

研究问题

  • RQ1在多种基础设施上进行深度学习训练时,哪些碳足迹估算工具在测量能耗方面最为准确?
  • RQ2估算工具自身的能耗在多大程度上影响碳足迹测量结果的可靠性?
  • RQ3仅测量部分训练周期并外推至整个训练过程,能在多大程度上提供准确的碳足迹估算?
  • RQ4批量大小和训练周期数等超参数如何影响测量到的能耗及工具性能?
  • RQ5这七种工具在测量方法、默认值设置和基础设施兼容性方面存在哪些关键差异?

主要发现

  • 仅测量部分训练周期并外推估算总能耗是一种可靠策略,因为各周期间的能耗保持相对稳定。
  • 估算工具自身的能耗虽小但不可忽视,尤其在大规模实验中,部分工具在2小时训练过程中能耗最高可达0.15千瓦时。
  • 不同工具的碳足迹估算结果差异显著,主要源于对空闲功耗、CPU/GPU使用率及使用率因子的建模与应用方式不同。
  • 仅估算过程级能耗的工具(如CodeCarbon、Eco2AI)在系统利用率较低时,报告的能耗值通常低于测量整机功耗的工具。
  • 工具选择应基于基础设施类型和测量目标(过程级 vs. 整节点监控)进行权衡。
  • 本研究证实,在利用率较低的基础设施上训练会导致更高的碳排放,凸显选择适当规模资源的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。