Skip to main content
QUICK REVIEW

[논문 리뷰] Greenhouse gases emissions: estimating corporate non-reported emissions using interpretable machine learning

Jérémi Assael, Thibaut Heurtebize|arXiv (Cornell University)|2022. 12. 21.
Forecasting Techniques and Applications인용 수 6
한 줄 요약

이 논문은 기업의 전 세계 범위 1 및 2 온실가스(GHG) 배출을 추정하기 위해 기울기 부스팅 결정 트리와 셰플리 값(Shapley values)을 사용한 투명하고 해석 가능한 기계학습 모델을 제안한다. 2022년 8월 기준으로 이 모델은 부문, 국가, 수익 그룹 전반에서 뛰어난 샘플 외 성능을 보이며, 다른 제공자들보다 정확도와 커버리지 측면에서 뛰어나다.

ABSTRACT

As of 2022, greenhouse gases (GHG) emissions reporting and auditing are not yet compulsory for all companies and methodologies of measurement and estimation are not unified. We propose a machine learning-based model to estimate scope 1 and scope 2 GHG emissions of companies not reporting them yet. Our model, specifically designed to be transparent and completely adapted to this use case, is able to estimate emissions for a large universe of companies. It shows good out-of-sample global performances as well as good out-of-sample granular performances when evaluating it by sectors, by countries or by revenues buckets. We also compare our results to those of other providers and find our estimates to be more accurate. Thanks to the proposed explainability tools using Shapley values, our model is fully interpretable, the user being able to understand which factors split explain the GHG emissions for each particular company.

연구 동기 및 목표

  • 보고하지 않는 범위 1 및 2 온실가스 배출을 가진 기업의 배출을 추정하는 것.
  • 금융 및 규제 용도에 적합한 투명하고 해석 가능한 모델을 개발하는 것.
  • 다양한 기업 프로필 전반에서 배출 추정의 정확도와 커버리지 향상.
  • 부문별 통찰을 얻기 위해 셰플리 값(Shapley values)을 활용한 배출 원인의 설명 가능성 제공.
  • EU의 CSRD와 같은 신규 규제에 대응하기 위해 감사 가능하고 확장 가능한 배출 추정을 지원하는 것.

제안 방법

  • 모델는 기업 수준의 재무, 운영 및 산업 데이터에서 범위 1 및 2 온실가스 배출을 예측하기 위해 기울기 부스팅 결정 트리(GDBT)를 사용한다.
  • 특징으로는 수익, 고정자산(GPPE 및 NPPE), 에너지 소비, 부문 분류(BICS L1–L4), 국가 수준의 에너지 밀도가 포함된다.
  • 모델 훈련은 Refinitiv, Bloomberg, MSCI, Trucost, CDP, 세계은행, IEA의 데이터를 활용하며, 일관성을 확보하기 위해 데이터 정제를 수행한다.
  • 설명 가능성은 SHAP(SHapley Additive exPlanations) 값으로 달성되어, 각 기업의 특징 기여도 분석이 가능하다.
  • 성능 평가는 샘플 외 지표인 평균 절대 오차(MAE), 제곱근 평균 제곱 오차(RMSE), 평균 최대 차이(MMD)를 사용한다.
  • 새로운 규제나 데이터 소스가 등장할 경우 유연하고 업데이트 가능한 설계가 되어 있다.

실험 결과

연구 질문

  • RQ1다양한 글로벌 기업 인구 전반에서 기계학습 모델이 미보고된 범위 1 및 2 온실가스 배출을 얼마나 정확하게 추정할 수 있는가?
  • RQ2모델은 부문, 국가, 수익 규모 카테고리 전반에서 얼마나 잘 일반화되는가?
  • RQ3배출 예측에 기여하는 특징의 기여도는 다양한 기업 유형에서 어떻게 달라지며, 이를 의미적으로 해석할 수 있는가?
  • RQ4정확도와 커버리지 측면에서 기존 제공자들의 추정과 비교해 모델의 성능은 어떠한가?
  • RQ5SHAP 값은 기업 수준에서 배출 원인을 효과적으로 설명할 수 있는가? 이는 모델 출력의 투명성과 신뢰도 향상에 기여하는가?

주요 결과

  • 모델은 글로벌, 부문별, 국가 수준, 수익 기반 그룹 전반에서 모든 평가 차원에서 뛰어난 샘플 외 성능을 보였다.
  • 2022년 8월 기준으로 다른 제공자들보다 정확도와 커버리지 측면에서 뛰어나, 더 많은 기업에 대한 추정이 가능했다.
  • SHAP 기반의 설명 가능성은 에너지 밀도 및 고정자산 노출 등 의미 있는 부문별 배출 원인을 드러냈다.
  • 모델은 다양한 기업 프로필에서 균형 잡힌 성능을 보였으며, 부문 및 지역 전반에서 낮은 편향과 일관된 오차 지표를 유지했다.
  • 정교한 데이터 정제 방법의 사용이 모델의 강건성과 일반화 능력을 향상시켰다.
  • 향후 개선 방향은 중소기업(SME) 데이터 커버리지 확대 및 다중 산업 분류 통합을 통한 혼합 부문 기업의 정확도 향상이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.