Skip to main content
QUICK REVIEW

[論文レビュー] CFBenchmark: Chinese Financial Assistant Benchmark for Large Language Model

Lei Yang, Jiangtong Li|arXiv (Cornell University)|Nov 10, 2023
Topic Modeling被引用数 5
ひとこと要約

CFBenchmarkは、中国語金融大規模言語モデル(LLM)の評価のための包括的なベンチマークを提供する。主な評価項目は、金融認識、分類、生成の3つである。3,917件の中国語金融テキストを用いて22体のLLMを評価した結果、一部のモデルは特定のタスクで優れた性能を示したが、すべてのタスクで優れた性能を発揮するモデルはなく、金融テキスト処理能力の向上の余地が依然として大きいことが明らかになった。

ABSTRACT

Large language models (LLMs) have demonstrated great potential in the financial domain. Thus, it becomes important to assess the performance of LLMs in the financial tasks. In this work, we introduce CFBenchmark, to evaluate the performance of LLMs for Chinese financial assistant. The basic version of CFBenchmark is designed to evaluate the basic ability in Chinese financial text processing from three aspects~(\emph{i.e.} recognition, classification, and generation) including eight tasks, and includes financial texts ranging in length from 50 to over 1,800 characters. We conduct experiments on several LLMs available in the literature with CFBenchmark-Basic, and the experimental results indicate that while some LLMs show outstanding performance in specific tasks, overall, there is still significant room for improvement in basic tasks of financial text processing with existing models. In the future, we plan to explore the advanced version of CFBenchmark, aiming to further explore the extensive capabilities of language models in more profound dimensions as a financial assistant in Chinese. Our codes are released at https://github.com/TongjiFinLab/CFBenchmark.

研究の動機と目的

  • 中国語金融LLMを評価する分野特化型ベンチマークの不足に対処すること。
  • 中国語における基本的な金融テキスト処理タスクを包括的に評価できるベンチマークを設計すること。
  • 実世界の中国語金融テキストデータを処理する際の、現在のLLMにおける性能ギャップを特定すること。
  • 構造的な評価フレームワークを通じて、今後の高度な金融AIアシスタント開発の基盤を提供すること。
  • 一般向けモデルと比較することで、分野適応型微調整の有効性を示すこと。

提案手法

  • CFBenchmark-Basicは、50文字から1,800文字を超える長さの高品質な中国語金融テキスト3,917件から構成されている。
  • ベンチマークは、金融認識(企業・製品)、分類(センチメント・セクター・イベント)、生成(要約・投資提案・リスクアラート)の3つの主要な評価分野に分類されている。
  • 各タスクは人間によるラベル検証を経て、データ品質と現実世界との整合性を確保している。
  • 22体の事前学習済みおよび微調整済みLLMを対象に、ゼロショットおよびフェイシング設定での実験が実施された。
  • F1スコアや正答率といった標準的な指標を用いて性能を評価し、タスクおよびモデルカテゴリごとに結果を集約した。
  • 分野特化型モデル(例:CFGPT1-sft-7B-LoRA)は微調整され、一般向け多言語・二言語モデルと比較することで、分野適応の影響を評価した。

実験結果

リサーチクエスチョン

  • RQ1現在のLLMは、中国語金融テキスト処理の基本的タスクにおいてどの程度の性能を示すか?
  • RQ2現在のLLMにおいて、金融認識、分類、生成の各分野における性能ギャップは何か?
  • RQ3分野特化型微調整は、一般向けモデルと比較してLLMの金融タスクにおける性能にどのように影響するか?
  • RQ4全体的な能力が優れているにもかかわらず、特定のタスクで性能が低いモデルの理由は何か?
  • RQ5多言語モデルは、単一言語の中国語モデルと比較して、金融テキスト理解においてどの程度性能が劣るのか?

主な発見

  • 公開済みのLLMのうち、認識・分類・生成の3つの主な評価分野すべてでF1スコアが0.6を超えるものは存在せず、改善の余地が依然として大きいことが示された。
  • ERNIE-Bot-4は金融認識で最高のスコア0.618を記録したが、InternLM-20Bは金融生成で最高のスコア0.695を達成した。
  • Baichuan2-13B-Chatはコンテンツ生成で最高のスコア0.706を記録したが、特にリスクアラート生成において一般的で繰り返しの多い回答が多かった。
  • Falcon や BLOOMZ などの多言語モデルは、同程度のサイズの二言語(中国語・英語)モデルと比較して性能が低く、金融タスクにおける言語特化型事前学習の重要性が浮き彫りになった。
  • 分野適応型モデル(例:CFGPT1-sft-7B-LoRA)は、一般向けモデルおよびパラメータをすべて使用した対応モデルを上回る性能を示し、金融データに対する微調整の有効性を裏付けた。
  • パラメータ数が多いモデルほど一般的に高い性能を示したが、特に情報抽出タスクにおいて顕著で、複雑な金融データを処理するには十分な容量が不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。