[論文レビュー] Supply chain emission estimation using large language models
本論文は、ドメイン適応型大規模言語モデル(LLM)を用いて、財務取引記述を米国環境保護庁(US EPA)のEEIO商品分類に分類することで、スコープ3排出ガスを推定する新規フレームワークを提案する。この手法は、従来のNLP技術を上回り、エキスパート水準の正確性を達成しており、企業全体にわたる排出ガス推定をスケーラブルに可能にし、SDG 13の目標達成を支援する。
Large enterprises face a crucial imperative to achieve the Sustainable Development Goals (SDGs), especially goal 13, which focuses on combating climate change and its impacts. To mitigate the effects of climate change, reducing enterprise Scope 3 (supply chain emissions) is vital, as it accounts for more than 90\% of total emission inventories. However, tracking Scope 3 emissions proves challenging, as data must be collected from thousands of upstream and downstream suppliers.To address the above mentioned challenges, we propose a first-of-a-kind framework that uses domain-adapted NLP foundation models to estimate Scope 3 emissions, by utilizing financial transactions as a proxy for purchased goods and services. We compared the performance of the proposed framework with the state-of-art text classification models such as TF-IDF, word2Vec, and Zero shot learning. Our results show that the domain-adapted foundation model outperforms state-of-the-art text mining techniques and performs as well as a subject matter expert (SME). The proposed framework could accelerate the Scope 3 estimation at Enterprise scale and will help to take appropriate climate actions to achieve SDG 13.
研究の動機と目的
- スコープ3排出ガスを推定するという重要な課題に取り組む。スコープ3排出ガスは企業排出ガスの90%以上を占めるが、数千ものサプライヤーに散在するデータのため、追跡が困難である。
- 手動でのデータ収集に依存せずに、NLPを用いて財務取引記述を標準化された商品分類に自動的にマッピングする、スケーラブルで自動化された手法を開発する。
- 微調整された基盤モデルが、排出ガス推定のための取引記述分類において、人間エキスパートのパフォーマンスに達するか、それを上回るかどうかを評価する。
- 財務取引記録がサプライチェーン排出ガスの信頼できる代理指標として機能できることを実証し、大規模な脱炭素化取り組みを可能にする。
提案手法
- 財務レジスタ記述のラベル付きデータセットを用いて、最先端の大規模言語モデル(roberta-base, bert-base-uncased, distilroberta-base-climate-f)を微調整し、商品分類のための分類タスクを実行する。
- 米国環境的拡張入出力(US EEIO)データベースを用いて、各商品クラスごとの排出係数を割り当て、取引データから炭素フットプリントを計算可能にする。
- 古典的NLPベースライン(TF-IDFおよびWord2Vecのベクトル化とその後続のテキスト分類)とモデルのパフォーマンスを比較する。
- 特に学習率とシーケンス長のハイパーパramータチューニングを実施し、モデルの収束性とパフォーマンスを最適化する。
- 訓練データを50%に制限した場合の性能低下を評価するため、アブレーションスタディを実施する。
- 取引記述を15種類のEEIO商品クラスにマッピングし、米ドル単位あたりの公表済み排出係数を用いて排出ガスを計算する。

実験結果
リサーチクエスチョン
- RQ1ドメイン適応型大規模言語モデルは、TF-IDF や Word2Vec といった古典的NLP手法を上回り、排出ガス推定のための取引記述を商品分類に分類するタスクで優れた性能を示すか?
- RQ2企業取引データに微調整した基盤モデルの分類精度は、ゼロショット分類と比較して、サプライチェーン排出ガス分類においてどの程度優れているか?
- RQ3特に学習率のハイパーパramータチューニングが、この文脈における微調整済みLLMの収束性とパフォーマンスにどの程度影響を与えるか?
- RQ4提案されたフレームワークは、排出ガス推定のための商品分類において、分野の専門家(SME)と同等か、それ以上の分類正確性を達成できるか?
- RQ5訓練データが減少した場合、モデルのパフォーマンスが著しく低下するか。これは、データへの感受性を示唆するか?
主な発見
- ドメイン適応型大規模言語モデルは、古典的NLP手法(TF-IDFおよびWord2Vec)を上回り、テストセットにおけるF1スコアが顕著に高い水準に達した。
- 微調整済みLLMは、bert-base-uncasedを用いることでF1スコア82.18%、roberta-baseを用いることで81.29%を達成し、商品分類タスクにおいて優れた性能を示した。
- 低い学習率で訓練したモデルは滑らかな収束を示し、バリデーション損失が低く抑えられ、一般化性能とテスト性能が向上した。
- アブレーションスタディの結果、訓練データを50%に制限した場合、F1スコアが低下した。これは、より大きなデータセットがモデルの頑健性と正確性を向上させることを示唆している。
- フレームワークは、取引記述の商品分類において、分野の専門家と同等か、それ以上のパフォーマンスを達成した。
- 排出ガス推定の結果、支出と排出ガスの間には直感的でない関係が明らかになった。例えば、電力(Utilities)は単位金額あたりの排出ガスが高く、一方でプロフェッショナルサービス(Professional Services)は高額な支出にもかかわらず排出ガスが低かった。これは、脱炭素化戦略の実行に向けた重要な機会を示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。