[论文解读] ClimateBert: A Pretrained Language Model for Climate-Related Text
ClimateBert 是一个在超过 200 万篇与气候相关的文本段落(来自新闻、研究论文和企业披露文件)上预训练的领域自适应、基于 Transformer 的语言模型。它在掩码语言建模任务上实现了 48% 的性能提升,并在下游任务(如文本分类、情感分析和事实核查)中将错误率降低了 3.57% 至 35.71%,在气候相关自然语言处理任务中优于通用领域模型。
Over the recent years, large pretrained language models (LM) have revolutionized the field of natural language processing (NLP). However, while pretraining on general language has been shown to work very well for common language, it has been observed that niche language poses problems. In particular, climate-related texts include specific language that common LMs can not represent accurately. We argue that this shortcoming of today's LMs limits the applicability of modern NLP to the broad field of text processing of climate-related texts. As a remedy, we propose CLIMATEBERT, a transformer-based language model that is further pretrained on over 2 million paragraphs of climate-related texts, crawled from various sources such as common news, research articles, and climate reporting of companies. We find that CLIMATEBERT leads to a 48% improvement on a masked language model objective which, in turn, leads to lowering error rates by 3.57% to 35.71% for various climate-related downstream tasks like text classification, sentiment analysis, and fact-checking.
研究动机与目标
- 解决通用语言模型在准确表达气候特定术语和话语方面的局限性。
- 开发一个在多样化、高质量气候相关文本上预训练的专用语言模型,以提升气候科学与政策领域中的自然语言处理性能。
- 在下游气候自然语言处理任务(如文本分类、情感分析和事实核查)中展示显著的性能提升。
- 通过在 GitHub 和 Hugging Face 上公开发布训练代码、模型权重和超参数,推动开放科学。
- 通过使用蒸馏后的轻量级模型(Distil RoBERTa)、高效的数据收集方式以及向 atmosfair 捐赠以抵消碳排放,最小化环境影响。
提出的方法
- 在包含 200 万篇来自新闻、科学论文和企业气候报告的高质量气候相关文本段落的大型、精心筛选语料库上,对基础 Distil RoBERTa 模型进行预训练。
- 通过在气候特定文本上微调基础模型,实施领域自适应预训练,以学习领域特定的语言模式和术语。
- 在预训练过程中以掩码语言建模(MLM)为主要目标,以损失减少作为评估领域自适应有效性的关键指标。
- 在三个下游任务上评估性能:气候风险/机遇声明的文本分类、企业披露文件的情感分析,以及气候主张的事实核查。
- 采用轻量级训练策略,最大限度减少超参数调优,以降低计算和碳成本,优先考虑高效、可复现的训练过程。
- 通过向 atmosfair 捐赠 100 欧元,而非依赖基于造林的碳抵消方式,来抵消模型的碳足迹,该组织专注于可再生能源和清洁技术项目。
实验结果
研究问题
- RQ1与通用领域模型相比,对气候特定文本进行领域自适应预训练是否能显著提升语言模型在下游气候自然语言处理任务中的性能?
- RQ2当在专用气候语料库上训练时,ClimateBert 的掩码语言建模损失与基线模型相比如何?
- RQ3ClimateBert 在与气候变化相关的文本分类、情感分析和事实核查任务中,错误率降低的幅度有多大?
- RQ4训练一个特定于气候的语言模型的环境成本是多少?如何在不牺牲性能的前提下加以缓解?
- RQ5像 Distil RoBERTa 这类蒸馏后的轻量级模型能否在最小化碳排放的同时,实现气候自然语言处理领域的最先进性能?
主要发现
- 与基础 Distil RoBERTa 模型相比,ClimateBert 在气候特定语料库上的掩码语言建模损失相对降低了 48%。
- 在文本分类任务中,ClimateBert 相较于基线模型将错误率降低了 3.57%,加权 F1 得分为 0.757,超越了先前的最先进结果。
- 在企业气候披露文件的情感分析中,ClimateBert 的加权 F1 得分为 0.757,相比基线模型错误率降低了 35.71%。
- 在 Climate-Fever 数据集上对气候主张的事实核查任务中,ClimateBert 的加权 F1 得分为 0.757,相比先前的 SotA 模型高出 3.89 个百分点。
- 模型的碳足迹测量为 115.15 kg CO2e,通过模型效率、数据质量控制以及向 atmosfair 捐赠 100 欧元用于可再生能源和清洁技术项目得以抵消。
- ClimateBert 在所有三个下游任务中的性能提升均保持一致,证明了领域自适应预训练在气候相关自然语言处理应用中的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。