Skip to main content
QUICK REVIEW

[論文レビュー] Greenhouse gases emissions: estimating corporate non-reported emissions using interpretable machine learning

Jérémi Assael, Thibaut Heurtebize|arXiv (Cornell University)|Dec 21, 2022
Forecasting Techniques and Applications被引用数 6
ひとこと要約

本論文は、勾配ブースティング決定木とシャープレイ値を用いて、企業の報告されていない範囲1および範囲2の温室効果ガス(GHG)排出量を推定する、透明性があり解釈可能な機械学習モデルを提案する。2022年8月現在、業界、国、収益グループの観点から、出荷外性能が強く、他の提供者よりも精度とカバレッジで優れている。

ABSTRACT

As of 2022, greenhouse gases (GHG) emissions reporting and auditing are not yet compulsory for all companies and methodologies of measurement and estimation are not unified. We propose a machine learning-based model to estimate scope 1 and scope 2 GHG emissions of companies not reporting them yet. Our model, specifically designed to be transparent and completely adapted to this use case, is able to estimate emissions for a large universe of companies. It shows good out-of-sample global performances as well as good out-of-sample granular performances when evaluating it by sectors, by countries or by revenues buckets. We also compare our results to those of other providers and find our estimates to be more accurate. Thanks to the proposed explainability tools using Shapley values, our model is fully interpretable, the user being able to understand which factors split explain the GHG emissions for each particular company.

研究の動機と目的

  • 報告されていない範囲1および範囲2の排出量を有する企業の温室効果ガス排出量を推定すること。
  • 金融および規制用途に適した透明性があり解釈可能なモデルを開発すること。
  • 多様な企業プロファイルにわたる排出量推定の精度とカバレッジを向上させること。
  • 業界別インサイトを得るため、シャープレイ値を用いた排出量ドライバーの説明可能性を可能にすること。
  • EUのCSRDなど、新たな規制に対応するため、監査可能でスケーラブルな排出量推定を提供すること。

提案手法

  • モデルは、企業レベルの財務、運用、業界データから、範囲1および範囲2のGHG排出量を予測するため、勾配ブースティング決定木(GDBT)を用いる。
  • 特徴量には、収益、固定資産(GPPEおよびNPPE)、エネルギー消費量、業界分類(BICS L1–L4)、国レベルのエネルギー強度が含まれる。
  • モデルのトレーニングは、Refinitiv、Bloomberg、MSCI、Trucost、CDP、World Bank、IEAのデータを活用し、一貫性を確保するためのデータキュレーションを実施する。
  • 解釈可能性はSHAP(SHapley Additive exPlanations)値を用いて達成され、各企業ごとの特徴量貢献度分析が可能になる。
  • 性能評価には、出荷外指標として、平均絶対誤差(MAE)、平均二乗誤差の平方根(RMSE)、平均最大差(MMD)が用いられる。
  • 新しい規制やデータソースが登場する際の柔軟性とアップデート可能性を考慮して、モデルが設計されている。

実験結果

リサーチクエスチョン

  • RQ1多様なグローバル企業集団にわたり、機械学習モデルは報告されていない範囲1および範囲2のGHG排出量をどの程度正確に推定できるか?
  • RQ2モデルは、業界、国、収益規模のカテゴリにわたってどの程度一般化できるか?
  • RQ3排出量予測への特徴量貢献度は、異なる企業タイプでどのように変化するか。そして、それらは意味的に解釈可能か?
  • RQ4精度とカバレッジの観点から、他の提供者の推定と比較して、モデルの性能はどの程度か?
  • RQ5SHAP値は、企業レベルでの排出量ドライバーを効果的に説明でき、モデル出力の透明性と信頼性を高めることができるか?

主な発見

  • モデルは、グローバル、業界別、国レベル、収益ベースのグループにわたるあらゆる評価次元で、強力な出荷外性能を達成している。
  • 2022年8月現在、他の提供者よりも精度とカバレッジで優れており、より多くの企業の推定が可能になっている。
  • SHAPに基づく解釈可能性により、エネルギー強度や固定資産への露出といった、業界固有の排出量ドライバーが明確に特定された。
  • モデルは多様な企業プロファイルにおいてバランスの取れた性能を示し、業界や地域を問わず、バイアスが低く、一貫性のある誤差指標を示している。
  • 洗練されたデータのクリーニング手法の採用により、モデルのロバスト性と一般化能力が向上した。
  • 今後の改善は、中小企業のデータカバレッジの拡大と、複数業界にまたがる企業の精度向上のためのマルチインダストリーカテゴリの統合に注力する予定である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。