[論文レビュー] A Survey of Large Language Models in Finance (FinLLMs)
この調査は、一般ドメインのLLMから金融ドメインのFinPLMsとFinLLMsへの進化をたどり、手法を比較し、六つのベンチマークと八つの高度なタスクを要約し、FinLLMs における機会と課題について論じる。
Large Language Models (LLMs) have shown remarkable capabilities across a wide variety of Natural Language Processing (NLP) tasks and have attracted attention from multiple domains, including financial services. Despite the extensive research into general-domain LLMs, and their immense potential in finance, Financial LLM (FinLLM) research remains limited. This survey provides a comprehensive overview of FinLLMs, including their history, techniques, performance, and opportunities and challenges. Firstly, we present a chronological overview of general-domain Pre-trained Language Models (PLMs) through to current FinLLMs, including the GPT-series, selected open-source LLMs, and financial LMs. Secondly, we compare five techniques used across financial PLMs and FinLLMs, including training methods, training data, and fine-tuning methods. Thirdly, we summarize the performance evaluations of six benchmark tasks and datasets. In addition, we provide eight advanced financial NLP tasks and datasets for developing more sophisticated FinLLMs. Finally, we discuss the opportunities and the challenges facing FinLLMs, such as hallucination, privacy, and efficiency. To support AI research in finance, we compile a collection of accessible datasets and evaluation benchmarks on GitHub.
研究の動機と目的
- 一般ドメインのPLMsから金融ドメインのFinPLMsおよびFinLLMsへの歴史的な推移を概説する。
- FinPLMsとFinLLMsで用いられる学習およびファインチューニング技術を比較する。
- 複数の金融NLPタスクとデータセットにおけるベンチマークの性能を要約する。
- 将来のFinLLM開発を指針とする高度な金融NLPタスクとデータセットを紹介する。
- 実世界の金融アプリケーションにおけるFinLLMsの機会、課題、実務上の考慮点について論じる。
提案手法
- GPTシリーズとオープンソースLLMからFinLLMsと金融ドメインモデルへの進化を調査する。
- 訓練データ、手法、指示型ファインチューニングに焦点を当て、4つのFinPLMsと4つのFinLLMsの5つの技術を比較する。
- 6つのベンチマークタスクとデータセットの性能を要約し、8つの高度な金融NLPタスクとデータセットを概説する。
- 将来のFinLLM研究を支援するために、GitHub上の利用可能なデータセットとベンチマークを整理する。
- FinLLMsにおけるプライバシー、効率性、幻覚(誤情報生成)などの実務的考慮点について論じる。

実験結果
リサーチクエスチョン
- RQ1一般ドメインのLMからFinLLMsへの歴史的推移はどのようなもので、それを定義するモデルは何か?
- RQ2FinPLMsとFinLLMsを特徴づける訓練、データ、およびファインチューニング技術は何か?
- RQ3確立された金融NLPベンチマークにおけるFinPLMsとFinLLMsの性能はどうか、高度なタスクで明らかになるギャップは何か?
- RQ4FinLLMsを進展させるために既存または必要とされるデータセットとベンチマークは何か、将来の研究にどう活用できるか?
主な発見
- 混合ドメインのFinPLMsは、感情分析、テキスト分類、NERタスクで高い性能を示す。
- タスク特化型のSOTAモデルはQA、SMP、要約タスクでFinLLMsを上回り、これらの分野でFinLLMsの改善余地を示している。
- GPT-4は要約を除くほとんどのベンチマークで高い性能を示すが、要約ではタスク特化モデルが優位。
- FinMA、InvestLM、FinGPT、BloombergGPTは、ライセンス、データソース、アーキテクチャの選択(LLaMAベース、BLOOM風など)の幅を示す。
- RAGなどの検索型アプローチは、FinLLMsの信頼性とプライバシーを向上させる有望な方向性として強調されている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。