[论文解读] LLMCO2: Advancing Accurate Carbon Footprint Prediction for LLM Inferences
LLMCO2 提出了一种基于图神经网络(GNN)的模型,通过分别建模自回归预填充(prefill)和解码(decode)阶段、引入硬件特定的 Roofline 性能指标,并对常见推理配置进行聚焦采样,实现了对大型语言模型(LLM)推理碳足迹的精确预测。与先前方法相比,该方法在预测精度上提升了 51%–123%,在 10% 误差下的误差边界准确率(EBA)达到最先进基线的 123%。
Throughout its lifecycle, a large language model (LLM) generates a substantially larger carbon footprint during inference than training. LLM inference requests vary in batch size, prompt length, and token generation number, while cloud providers employ different GPU types and quantities to meet diverse service-level objectives for accuracy and latency. It is crucial for both users and cloud providers to have a tool that quickly and accurately estimates the carbon impact of LLM inferences based on a combination of inference request and hardware configurations before execution. Estimating the carbon footprint of LLM inferences is more complex than training due to lower and highly variable model FLOPS utilization, rendering previous equation-based models inaccurate. Additionally, existing machine learning (ML) prediction methods either lack accuracy or demand extensive training data, as they inadequately handle the distinct prefill and decode phases, overlook hardware-specific features, and inefficiently sample uncommon inference configurations. We introduce \coo, a graph neural network (GNN)-based model that greatly improves the accuracy of LLM inference carbon footprint predictions compared to previous methods.
研究动机与目标
- 为解决 LLM 推理中缺乏准确、实时的碳足迹估算工具的问题,该问题比训练更复杂,原因在于 FLOPS 利用率的波动性和自回归行为。
- 克服现有基于方程和基于机器学习的模型的局限性,这些模型无法捕捉预填充/解码阶段的差异、硬件特定特征以及真实世界配置分布。
- 开发一种可扩展、高精度的预测模型,使用户和云服务提供商能够在推理执行前评估延迟、准确率与碳排放之间的权衡。
- 通过针对性的数据采样和基于图的建模,提升在多样化 LLM 架构、GPU 类型以及常见推理配置(如小批量、短提示)下的预测可靠性。
提出的方法
- LLMCO2 采用一种新颖的图嵌入技术,将每个 Transformer 层的核函数表示为图结构,其中节点代表核函数,边代表数据依赖关系。
- 为预填充和解码阶段分别应用节点特征编码,以建模其独特的计算特性。
- 通过 Roofline 性能指标整合 GPU 峰值吞吐量、内存带宽和网络带宽等硬件特定特征,提升在不同 GPU 平台上的泛化能力。
- 采用聚焦数据采样策略,优先选择常见真实场景配置——如小批量、短提示和有限的标记生成——以提升模型在典型推理工作负载上的表现。
- 基于 GNN 的回归模型学习输入配置(提示长度、批量大小、生成标记数)与碳排放之间的关系,实现在推理时的快速预测。
- 模型在经过筛选的多 LLM(如 Bloom、Gemma、Mixtral)和多 GPU(如 A100、L4、T4)组合的能效测量数据集上进行训练,重点关注运行时能耗和碳排放开销。

实验结果
研究问题
- RQ1如何通过分别建模预填充和解码阶段,提升 LLM 推理的碳足迹预测性能?
- RQ2GPU 吞吐量和内存带宽等硬件特定特征在不同 GPU 平台上的应用,能在多大程度上提升预测精度?
- RQ3对常见推理配置进行聚焦采样,是否能增强模型在真实工作负载上的泛化能力和准确性?
- RQ4基于 GNN 的方法相较于现有机器学习和基于方程的模型,在预测 LLM 推理碳足迹方面表现如何?
- RQ5架构和配置多样性(如批量大小、提示长度、模型规模)对碳足迹预测精度有何影响?
主要发现
- LLMCO2 在多种 LLM 和 GPU 配置下,相比现有基于机器学习的能耗预测器,预测精度提升了 51%–123%。
- 在所有测试模型中,与次优基线 NNLQP 相比,LLMCO2 在 10% 误差下的误差边界准确率(EBA)高出 123%。
- 该模型的 EBA(10%) 平均达到 45.7%,其中 Bloom 达到最高 60%,Qwen2 达到 53.1%,展现出强大的泛化能力。
- 与统一阶段建模方法相比,分别建模预填充和解码阶段使 EBA(10%) 提升 67%,凸显阶段感知设计的重要性。
- 将 Roofline 性能作为节点特征后,EBA(10%) 提升 13.1%,实现了在 L4 和 T4 等不同 GPU 类型间的更好知识迁移。
- 聚焦采样策略贡献最大,使 EBA(10%) 相较于 NNLQP 提升 123%,证明了数据分布与真实使用场景对齐可显著提升模型性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。