Skip to main content
QUICK REVIEW

[论文解读] FinBERT: A Pretrained Language Model for Financial Communications

Yi Yang, Mark Christopher Siy Uy|arXiv (Cornell University)|Jun 15, 2020
Topic Modeling参考文献 11被引用 176
一句话总结

FinBERT,是一个面向金融领域的 BERT 模型,在来自金融文本的 4.9B 个标记上进行预训练,在三个金融情感任务中优于通用的 BERT。

ABSTRACT

Contextual pretrained language models, such as BERT (Devlin et al., 2019), have made significant breakthrough in various NLP tasks by training on large scale of unlabeled text re-sources.Financial sector also accumulates large amount of financial communication text.However, there is no pretrained finance specific language models available. In this work,we address the need by pretraining a financial domain specific BERT models, FinBERT, using a large scale of financial communication corpora. Experiments on three financial sentiment classification tasks confirm the advantage of FinBERT over generic domain BERT model. The code and pretrained models are available at https://github.com/yya518/FinBERT. We hope this will be useful for practitioners and researchers working on financial NLP tasks.

研究动机与目标

  • 基于金融文本中存在的领域特定情感信号,激发对金融领域预训练语言模型的需求。
  • 通过在大规模金融语料上对 BERT 进行预训练来构建 FinBERT。
  • 展示 FinBERT 在金融情感分类任务中优于通用 BERT 的表现。

提出的方法

  • 构建 FinVocab(金融聚焦)和 FinBERT 变体(BaseVocab/FinVocab;区分大小写)。
  • 在来自企业报告、业绩电话会议记录和分析师报告的大约 4.9B 个标记上对 FinBERT 进行预训练。
  • 使用简单的线性分类器和交叉熵损失对 FinBERT 进行情感任务的微调。
  • 在三个数据集上将 FinBERT 与 BERT-Base(有大小写)进行对比。
  • 在多个数据划分上使用准确率进行评估,以评估性能提升。

实验结果

研究问题

  • RQ1在标准数据集上,FinBERT 是否相较于通用 BERT 提高了金融情感分类的表现?
  • RQ2领域内词汇(FinVocab)和对全部金融语料进行预训练如何影响性能?
  • RQ3在金融自然语言处理任务中,未大小写区分的模型是否持续优于有大小写区分的模型?
  • RQ4将不同金融语料合并对 FinBERT 的性能有何影响?

主要发现

  • 在 PhraseBank 上,最佳 FinBERT 模型(uncased FinVocab)达到 0.872 的准确率,比 uncased BERT 提高 4.4%,比 cased BERT 提高 15.4%。
  • 在 FiQA 上,最佳 FinBERT 模型(uncased FinVocab)达到 0.844 的准确率,比 uncased BERT 提高 15.6%,比 cased BERT 高 29.2%。
  • 在 AnalystTone 上,最佳 FinBERT 模型(uncased FinVocab)达到 0.887,较 uncased BERT 提升 4.3%,较 cased BERT 提升 5.5%。
  • 在所有金融语料上进行预训练的 FinBERT 模型表现最佳,其中 Analyst Reports 对各任务贡献了显著的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。