[論文レビュー] CFGPT: Chinese Financial Assistant with Large Language Model
CFGPTは、洗練された金融データセット(CFData)、微調整された70億パラメータのLLM(CFLLM)、実世界でのデプロイメントシステム(CFAPP)を統合した中国語金融用大規模言語モデルフレームワークです。1410億トークンの事前学習と、6つの金融タスクで150億トークンの教師あり微調整を経て訓練された本モデルは、中国語金融NLPにおける強力なゼロショットおよびフェイワショット性能を達成しており、コミュニティ利用を目的としたコードとモデルをオープンソースで公開しています。
Large language models (LLMs) have demonstrated great potential in natural language processing tasks within the financial domain. In this work, we present a Chinese Financial Generative Pre-trained Transformer framework, named CFGPT, which includes a dataset~(CFData) for pre-training and supervised fine-tuning, a financial LLM~(CFLLM) to adeptly manage financial texts, and a deployment framework~(CFAPP) designed to navigate real-world financial applications. The CFData comprising both a pre-training dataset and a supervised fine-tuning dataset, where the pre-training dataset collates Chinese financial data and analytics, alongside a smaller subset of general-purpose text with 584M documents and 141B tokens in total, and the supervised fine-tuning dataset is tailored for six distinct financial tasks, embodying various facets of financial analysis and decision-making with 1.5M instruction pairs and 1.5B tokens in total. The CFLLM, which is based on InternLM-7B to balance the model capability and size, is trained on CFData in two stage, continued pre-training and supervised fine-tuning. The CFAPP is centered on large language models (LLMs) and augmented with additional modules to ensure multifaceted functionality in real-world application. Our codes are released at https://github.com/TongjiFinLab/CFGPT.
研究の動機と目的
- 中国語金融テキスト向けの特化型大規模言語モデルの不足に応えるために、専用のフレームワークを開発すること。
- 金融NLPタスクのための事前学習および教師あり微調整データを統合した包括的な中国語金融データセット(CFData)を構築すること。
- 2段階の訓練プロセス(継続的事前学習と教師あり微調整)を用いて、CFData上で金融最適化されたLLM(CFLLM)を訓練すること。
- 多様な入力形式と出力形式をサポートする実用的なデプロイメントフレームワーク(CFAPP)を設計し、実世界の金融応用を支援すること。
- コードとモデルをオープンソースで公開することで、中国語金融LLM分野の研究と応用を促進すること。
提案手法
- CFDataを構築。2部構成のデータセット:事前学習用に5億8400万件のドキュメント(1410億トークン)と、6つの金融タスクで150万組の指示ペア(150億トークン)を用いた教師あり微調整用。
- パフォーマンスと効率のバランスを考慮し、InternLM-7Bをベースモデルとして選定。金融言語への効果的な適応を可能にした。
- 2段階の訓練を実施:まず、金融および一般中国語コーパス上で継続的事前学習を行い、次にタスク固有の指示ペアで教師あり微調整を実施。
- LLMを中心としたモジュラーデプロイメントシステムとしてCFAPPを設計。ベクトルデータベース、チェーン・オブ・チョイス推論、および分野特化モジュールを統合し、応答の正確性と信頼性を向上。
- テキスト、音声、PDFのマルチモーダル入力対応と、生テキスト、テンプレート、マインドマップの複数の出力形式をサポートすることで、実際の金融現場での使いやすさを向上。
- InternLM-7B以外のLLMへの拡張性を実装し、フレームワークの柔軟性を向上。
実験結果
リサーチクエスチョン
- RQ1洗練された中国語金融データセット上で訓練された特化型大規模言語モデルは、汎用LLMと比較して、金融NLPタスクで優れた性能を発揮するか?
- RQ2継続的事前学習 followed by 教師あり微調整という2段階訓練は、中国語金融テキスト理解におけるゼロショットおよびフェイワショット能力の向上にどの程度効果的か?
- RQ3モジュラーデプロイメントフレームワーク(CFAPP)は、実世界の金融応用において、多様な入力形式と出力形式をどの程度効果的にサポートできるか?
- RQ4ベクトルデータベースとチェーン・オブ・チョイス推論モジュールの統合は、金融LLMの応答における事実の正確性と推論能力をどの程度向上させるか?
- RQ5分野特化型微調整は、中国語金融環境下での感情分析、イベント検出、株価予測などのタスクにどのような影響を与えるか?
主な発見
- CFLLM-ins-7Bモデルは、6つの金融タスクで優れた性能を示し、分野特化型の継続的事前学習と教師あり微調整の有効性を裏付けた。
- CFDataデータセットは、事前学習用に1410億トークン、微調整用に150億トークンを有し、中国語金融LLMの訓練に包括的なリソースを提供する。
- CFAPPフレームワークは、テキスト、音声、PDFといった多様な入力タイプと、生テキスト、テンプレート、マインドマップといった多様な出力形式を効果的にサポートし、実世界での利用可能性を向上させた。
- ベクトルデータベースとチェーン・オブ・チョイスモジュールの統合により、金融推論タスクにおける応答の信頼性と事実の整合性が向上した。
- GitHubを通じたコード、モデル、データセットのオープンソース公開により、中国語金融LLM分野における研究とイノベーションの加速が期待される。
- 初期評価では、ゼロショットおよびフェイワショット設定下でのモデルの能力が確認され、特に感情分析、要約、金融テキストに関する質疑応答タスクで顕著な性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。