[论文解读] Detecting ESG topics using domain-specific language models and data augmentation approaches
本文提出 BERT RNA,一种在 7.15 亿词的金融与商业新闻语料上预训练的领域特定语言模型,显著提升了 ESG 争议和联合国可持续发展目标(UN SDG)分类的准确率。通过结合领域内预训练与回译数据增强,该方法在小规模标注 ESG 数据集上相较通用领域 BERT 实现了显著的性能提升。
Despite recent advances in deep learning-based language modelling, many natural language processing (NLP) tasks in the financial domain remain challenging due to the paucity of appropriately labelled data. Other issues that can limit task performance are differences in word distribution between the general corpora - typically used to pre-train language models - and financial corpora, which often exhibit specialized language and symbology. Here, we investigate two approaches that may help to mitigate these issues. Firstly, we experiment with further language model pre-training using large amounts of in-domain data from business and financial news. We then apply augmentation approaches to increase the size of our dataset for model fine-tuning. We report our findings on an Environmental, Social and Governance (ESG) controversies dataset and demonstrate that both approaches are beneficial to accuracy in classification tasks.
研究动机与目标
- 解决金融 NLP 中因低质量且标注数据有限而带来的挑战,特别是针对 ESG 相关分类任务。
- 通过将预训练语言模型适配至金融文本,提升模型在 ESG 争议与联合国可持续发展目标(UN SDG)分类任务上的表现。
- 探究在领域内预训练与数据增强是否能够缓解通用领域语言模型与金融语料之间的分布偏移问题。
- 开发一种专用于 ESG 与可持续性相关文本分析的金融领域语言模型(BERT RNA)。
- 评估微调模型中注意力头的语言学行为,以理解哪些文本特征驱动了分类性能。
提出的方法
- 在来自路透社新闻档案的 7.15 亿词金融与商业新闻语料上,预训练一个 BERT BASE 模型,构建 BERT RNA。
- 在小规模、已标注的 ESG 争议数据集上微调 BERT RNA,用于多分类 ESG 争议分类与多标签 UN SDG 检测。
- 应用回译数据增强技术,以提升训练数据的多样性与规模,增强泛化能力并减少过拟合。
- 通过自注意力可视化分析不同层的注意力头对名词、动词、数字与代词等语言学特征的响应方式。
- 使用标准指标,将 BERT RNA 与通用领域 BERT BASE 在 ESG 与 SDG 分类任务上的表现进行对比。
- 评估未来扩展方向,包括领域特定词汇与扩展预训练语料(如 SEC 文件、盈利电话记录)的影响。
实验结果
研究问题
- RQ1相较于通用领域 BERT,基于金融与商业新闻进行领域内预训练是否能提升 BERT 在 ESG 主题分类任务上的表现?
- RQ2通过回译实现的数据增强在小规模 ESG 标注数据集上在多大程度上提升了模型准确率与泛化能力?
- RQ3BERT RNA 中与 ESG 分类相关的层中,注意力模式与通用 BERT 有何不同?哪些语言学特征(如名词、动词、数字)最受关注?
- RQ4领域特定语言建模与数据增强是否能协同缓解通用文本与金融文本之间分布偏移导致的性能下降?
- RQ5将预训练扩展至包括 10-K/10-Q 文件或盈利电话记录等额外金融文本来源,可能带来哪些潜在收益?
主要发现
- 在 ESG 争议分类任务上微调 BERT RNA 所取得的准确率高于微调通用领域 BERT BASE,证明了领域内预训练的优势。
- 通过回译实现的数据增强显著提升了模型性能,尤其在小规模数据集上,通过增加训练多样性与减少过拟合来实现。
- 微调后的 BERT RNA 显示出对数字(第 6–10 层)、动词(第 11–12 层)、名词(第 11 层)与代词(第 11–12 层)的注意力增强,表明这些特征在 ESG 分类中具有重要意义。
- 本研究证明,领域特定语言模型与数据增强是提升低资源金融 NLP 场景下 NLP 性能的有效策略。
- 结果表明,引入领域特定词汇并扩展至更多样化的金融文本来源(如 SEC 文件)可能带来进一步的性能提升。
- 这是首次已知将金融领域 BERT 模型应用于 ESG 争议预测,为未来金融领域生成 alpha 的 NLP 系统奠定了基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。