Skip to main content
QUICK REVIEW

[論文レビュー] Detecting ESG topics using domain-specific language models and data augmentation approaches

Tim Nugent, Nicole Stelea|arXiv (Cornell University)|Oct 16, 2020
Computational and Text Analysis Methods被引用数 8
ひとこと要約

本稿では、7億1500万語の金融・ビジネス関連ニュースを事前学習したドメイン特化型言語モデル BERT RNA を提案する。このモデルは、ESGスキャンダルおよび国連持続可能な開発目標(UN SDG)分類の精度を向上させる。一般ドメイン BERT に対して、ドメイン内事前学習とバックトランスレーションを用いたデータ拡張を組み合わせることで、小規模でラベル付きの ESG データセットにおいて顕著な性能向上を達成した。

ABSTRACT

Despite recent advances in deep learning-based language modelling, many natural language processing (NLP) tasks in the financial domain remain challenging due to the paucity of appropriately labelled data. Other issues that can limit task performance are differences in word distribution between the general corpora - typically used to pre-train language models - and financial corpora, which often exhibit specialized language and symbology. Here, we investigate two approaches that may help to mitigate these issues. Firstly, we experiment with further language model pre-training using large amounts of in-domain data from business and financial news. We then apply augmentation approaches to increase the size of our dataset for model fine-tuning. We report our findings on an Environmental, Social and Governance (ESG) controversies dataset and demonstrate that both approaches are beneficial to accuracy in classification tasks.

研究の動機と目的

  • 金融 NLP における低品質で限られたラベル付きデータの課題に対処すること、特に ESG 関連分類に焦点を当てる。
  • 金融テキストに適応した事前学習言語モデルの微調整により、ESGスキャンダルおよび国連持続可能な開発目標(UN SDG)分類のモデル性能を向上させること。
  • 一般ドメイン言語モデルと金融コーパスの間の分布シフトを、ドメイン内事前学習とデータ拡張によって緩和できるかどうかを検証すること。
  • ESG および持続可能性関連テキスト分析に特化した金融ドメイン言語モデル(BERT RNA)を構築すること。
  • 微調整済みモデルにおけるアテンションヘッドの言語的行動を評価し、分類性能を左右するテキスト特徴を理解すること。

提案手法

  • リーマンズ・ニュースアーカイブから得た 7億1500万語の金融・ビジネス関連ニュースコーパスを用いて、BERT BASE モデルを事前学習し、BERT RNA を作成する。
  • マルチクラス分類とマルチラベル UN SDG 検出のため、小規模でラベル付きの ESG スキャンダルデータセット上で BERT RNA を微調整する。
  • バックトランスレーションを用いたデータ拡張を適用し、訓練データの多様性とサイズを向上させ、一般化性能を向上させるとともに過学習を軽減する。
  • 自己注意可視化を用いて、異なる層におけるアテンションヘッドが名詞、動詞、数字、代名詞などの言語的特徴にどのように反応するかを分析する。
  • 標準指標を用いて、ESG および SDG 分類タスクにおける BERT RNA と一般ドメイン BERT BASE の性能を比較する。
  • 今後の拡張として、ドメイン特化語彙や拡張事前学習コーパス(例:SEC提出書類、決算会議録)の影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1一般ドメイン BERT と比較して、金融・ビジネス関連ニュースを用いたドメイン内事前学習が、ESGトピック分類タスクにおける BERT の性能を向上させるか?
  • RQ2バックトランスレーションによるデータ拡張は、小規模なラベル付き ESG データセットにおいて、モデルの精度と一般化性能をどの程度向上させるか?
  • RQ3ESG分類に寄与する層において、BERT RNA のアテンションパターンは一般 BERT とどのように異なるか。また、名詞、動詞、数字などのどの言語的特徴が最も注目されているか?
  • RQ4ドメイン特化型言語モデルとデータ拡張を併用することで、一般ドメインと金融テキストの間の分布シフトによって引き起こされる性能低下を緩和できるか?
  • RQ510-K/10-Q提出書類や決算会議録トランスクリプトなどの追加金融テキストソースを事前学習に組み込むことで得られる潜在的利点は何か?

主な発見

  • 一般ドメイン BERT BASE を用いた ESG スキャンダル分類の微調整に比べ、BERT RNA を用いた微調整により高い精度が達成された。これはドメイン内事前学習の有効性を示している。
  • バックトランスレーションによるデータ拡張は、訓練データの多様性を高め、過学習を軽減することで、特に小規模データセットにおいてモデル性能を顕著に向上させた。
  • 微調整済み BERT RNA は、層 6〜10 で数字、層 11〜12 で動詞・代名詞、層 11 で名詞に注目する傾向を示し、これらが ESG 分類において重要であることを示唆している。
  • 本研究は、ドメイン特化型言語モデルとデータ拡張が、リソースが限られた金融 NLP 環境における NLP 性能向上に有効であることを示している。
  • ドメイン特化語彙や多様な金融テキストソース(例:SEC提出書類)を用いた拡張事前学習により、さらなる性能向上が得られる可能性がある。
  • 本研究は、金融ドメイン BERT モデルを ESG スキャンダル予測に応用した初の事例であり、今後の金融分野におけるアルファ生成 NLP システムの基盤を築いた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。