[论文解读] Greenhouse gases emissions: estimating corporate non-reported emissions using interpretable machine learning
本文提出了一种透明、可解释的机器学习模型,利用梯度提升决策树和Shapley值,估算全球企业未报告的范围1和范围2温室气体(GHG)排放。截至2022年8月,该模型在不同行业、国家和收入群体中均表现出优异的样本外性能,其准确性和覆盖范围优于其他提供商。
As of 2022, greenhouse gases (GHG) emissions reporting and auditing are not yet compulsory for all companies and methodologies of measurement and estimation are not unified. We propose a machine learning-based model to estimate scope 1 and scope 2 GHG emissions of companies not reporting them yet. Our model, specifically designed to be transparent and completely adapted to this use case, is able to estimate emissions for a large universe of companies. It shows good out-of-sample global performances as well as good out-of-sample granular performances when evaluating it by sectors, by countries or by revenues buckets. We also compare our results to those of other providers and find our estimates to be more accurate. Thanks to the proposed explainability tools using Shapley values, our model is fully interpretable, the user being able to understand which factors split explain the GHG emissions for each particular company.
研究动机与目标
- 估算未报告范围1和范围2温室气体排放的企业排放量。
- 开发一种透明、可解释的模型,适用于金融和监管用途。
- 提升在多样化企业特征下的排放估算准确性和覆盖范围。
- 通过Shapley值实现排放驱动因素的可解释性,提供行业特定的洞察。
- 通过提供可审计、可扩展的排放估算,支持应对新兴法规(如欧盟CSRD)的合规性。
提出的方法
- 该模型使用梯度提升决策树(GDBT)从企业层面的财务、运营和行业数据中预测范围1和范围2温室气体排放。
- 特征包括收入、固定资产(GPPE和NPPE)、能源消耗、行业分类(BICS L1–L4)以及国家层面的能源强度。
- 模型训练利用来自Refinitiv、Bloomberg、MSCI、Trucost、CDP、世界银行和IEA的数据,通过数据整理确保一致性。
- 通过SHAP(SHapley Additive exPlanations)值实现可解释性,支持按公司进行特征贡献分析。
- 性能通过样本外指标进行评估:平均绝对误差(MAE)、均方根误差(RMSE)和平均最大差异(MMD)。
- 该模型设计具有灵活性,可随新法规或数据源的出现而更新。
实验结果
研究问题
- RQ1在多样化的全球企业群体中,机器学习模型在估算未报告的范围1和范围2温室气体排放方面有多准确?
- RQ2该模型在不同行业、国家和收入规模类别中的泛化能力如何?
- RQ3不同企业类型在排放预测中的特征贡献有何差异,这些差异是否具有可解释性?
- RQ4与现有提供商的估算相比,该模型在准确性和覆盖范围方面的表现如何?
- RQ5SHAP值能否有效解释企业层面的排放驱动因素,从而实现模型输出的透明度和可信度?
主要发现
- 该模型在所有评估维度(包括全球、行业、国家层面和收入分组)中均表现出优异的样本外性能。
- 截至2022年8月,该模型在准确性和覆盖范围上均优于其他提供商,可估算的企业数量更多。
- 基于SHAP的可解释性揭示了有意义的、与行业相关的排放驱动因素,如能源强度和固定资产暴露。
- 该模型在多样化的企业特征中表现出均衡性能,各行业和地区偏差较低,误差指标一致。
- 采用优化的数据清洗方法显著增强了模型的稳健性和泛化能力。
- 未来改进将聚焦于扩大中小企业数据覆盖范围,并整合多行业分类,以提升混合行业企业估算的准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。