[论文解读] Supply chain emission estimation using large language models
本文提出了一种新颖的框架,利用领域自适应的大规模语言模型(LLMs)通过将财务交易描述分类到美国环保局EEIO商品类别来估算范围3排放。该方法优于传统NLP技术,并达到专家级准确度,实现了可扩展的企业级排放估算,以支持可持续发展目标13。
Large enterprises face a crucial imperative to achieve the Sustainable Development Goals (SDGs), especially goal 13, which focuses on combating climate change and its impacts. To mitigate the effects of climate change, reducing enterprise Scope 3 (supply chain emissions) is vital, as it accounts for more than 90\% of total emission inventories. However, tracking Scope 3 emissions proves challenging, as data must be collected from thousands of upstream and downstream suppliers.To address the above mentioned challenges, we propose a first-of-a-kind framework that uses domain-adapted NLP foundation models to estimate Scope 3 emissions, by utilizing financial transactions as a proxy for purchased goods and services. We compared the performance of the proposed framework with the state-of-art text classification models such as TF-IDF, word2Vec, and Zero shot learning. Our results show that the domain-adapted foundation model outperforms state-of-the-art text mining techniques and performs as well as a subject matter expert (SME). The proposed framework could accelerate the Scope 3 estimation at Enterprise scale and will help to take appropriate climate actions to achieve SDG 13.
研究动机与目标
- 为解决范围3排放估算这一关键挑战,范围3排放占企业排放总量的90%以上,但由于数据分散在数千家供应商中,难以追踪。
- 开发一种可扩展的自动化方法,利用NLP将财务交易描述映射到标准化商品类别,避免依赖人工数据收集。
- 评估微调的基础模型是否能在分类交易描述以用于排放估算方面,达到或超过人类专家的表现。
- 证明财务交易记录可作为供应链排放的可靠代理,支持大规模脱碳努力。
提出的方法
- 在财务分类描述的标注数据集上微调最先进的大规模语言模型——roberta-base、bert-base-uncased 和 distilroberta-base-climate-f,用于商品分类。
- 使用美国环境延伸投入产出(US EEIO)数据库为每类商品分配排放因子,从而实现从交易数据计算碳足迹。
- 将模型性能与经典NLP基线方法进行比较:使用TF-IDF和Word2Vec向量化后进行文本分类。
- 应用超参数调优,特别是初始学习率和序列长度,以优化模型收敛性和性能。
- 通过减少50%的训练数据进行消融研究,以评估数据敏感性和模型鲁棒性。
- 将交易描述映射到15个EEIO商品类别,并使用每美元支出的已发布排放因子计算排放量。

实验结果
研究问题
- RQ1领域自适应的大规模语言模型是否能在将财务交易描述分类到商品类别以用于排放估算方面,优于传统NLP方法(如TF-IDF和Word2Vec)?
- RQ2在企业交易数据上微调基础模型与零样本分类相比,在供应链排放分类准确度方面表现如何?
- RQ3在该背景下,超参数调优(特别是学习率)在多大程度上影响微调LLM的收敛性和性能?
- RQ4所提出的框架是否能达到与领域专家(SME)在商品分类中用于排放估算的分类准确度相当或更优?
- RQ5当训练数据减少时,模型性能是否显著下降,表明其对数据量敏感?
主要发现
- 领域自适应的大规模语言模型优于经典NLP技术(TF-IDF和Word2Vec),在测试集上实现了显著更高的F1分数。
- 微调后的LLM使用bert-base-uncased获得82.18%的F1分数,使用roberta-base获得81.29%的F1分数,表明在商品分类任务中表现强劲。
- 采用较低学习率训练的模型表现出更平稳的收敛过程和更低的验证损失,提升了泛化能力与测试性能。
- 消融研究显示,将训练数据减少至50%导致F1分数下降,表明更大的数据集可提升模型鲁棒性与准确性。
- 该框架在将交易描述分类到商品类别方面的表现与或超过领域专家水平。
- 排放估算揭示了支出与排放之间非直观的关系——例如,公用事业类每美元支出的排放量很高,而尽管支出高,专业服务类的排放量却很低——凸显了战略性脱碳机会。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。