[論文レビュー] FinTral: A Family of GPT-4 Level Multimodal Financial Large Language Models
FinTralは、Mistral-7bを基盤とし、分野特化型の事前学習、指示微調整、およびGPT-4が生成したフィードバックを用いた直接的好み最適化(DPO)を組み合わせた、マルチモーダルな金融LLMのファミリーを導入する。その最良のバリエーションであるFinTral-DPO-T&Rは、9つの金融タスクのうち5つでGPT-4レベルのパフォーマンスを達成し、全タスクでゼロショット評価においてChatGPT-3.5およびGPT-4を上回り、最先端のマルチモーダル金融推論能力を示している。
We introduce FinTral, a suite of state-of-the-art multimodal large language models (LLMs) built upon the Mistral-7b model and tailored for financial analysis. FinTral integrates textual, numerical, tabular, and image data. We enhance FinTral with domain-specific pretraining, instruction fine-tuning, and RLAIF training by exploiting a large collection of textual and visual datasets we curate for this work. We also introduce an extensive benchmark featuring nine tasks and 25 datasets for evaluation, including hallucinations in the financial domain. Our FinTral model trained with direct preference optimization employing advanced Tools and Retrieval methods, dubbed FinTral-DPO-T&R, demonstrates an exceptional zero-shot performance. It outperforms ChatGPT-3.5 in all tasks and surpasses GPT-4 in five out of nine tasks, marking a significant advancement in AI-driven financial technology. We also demonstrate that FinTral has the potential to excel in real-time analysis and decision-making in diverse financial contexts. The GitHub repository for FinTral is available at \url{https://github.com/UBC-NLP/fintral}.
研究の動機と目的
- 既存のLLMが金融分析において数値推論、分野特化した専門用語、および金融文脈における架空情報(ホールリュケーション)の問題を抱えることへの対処。
- テキスト、数値、表形式、視覚的金融データを処理できるマルチモーダルLLMの開発。これにより、文書全体の理解を包括的に行えるようにする。
- 25のデータセットと9つのタスクを含む、ホールリュケーション検出を含む大規模かつ包括的なベンチマーク「FinSet」の構築。
- 高度なアライメント手法とリtrieval補強プロンプティングを用いることで、より小さな分野適応型LLMがGPT-4のような大規模モデルを、重要な金融推論タスクで上回ることの実証。
提案手法
- FinTralはMistral-7bアーキテクチャに基づき、選別された金融テキストおよび視覚データを用いた分野特化型の事前学習により微調整されている。
- 指示微調整は、感情分析、エンティティ認識、金融推論などの金融タスクに特化した、大規模かつ選別された指示データセットを用いて実施されている。
- 直接的好み最適化(DPO)を用いて、GPT-4が生成した応答とモデルを一致させることで、人間からのフィードバックを用いた強化学習(RLHF)を必要とせずにアライメントを向上させている。
- 推論時に外部知識に動的アクセスできるよう、リtrievalおよびツール補強プロンプティング(T&R)によりモデルを強化している。
- 視覚的機能はCLIPの視覚エンコーダーを介して追加され、画像や図を含む金融文書のマルチモーダル理解を可能にするFinTralVLが構築された。
- 25のデータセットを含む9つのタスク(ホールリュケーション検出を含む)を有する包括的で大規模なベンチマーク「FinSet」が構築され、モデルのパフォーマンスを厳密に評価している。

実験結果
リサーチクエスチョン
- RQ1より小さな分野適応型LLMは、金融推論タスクでGPT-4レベルのパフォーマンスを達成できるか?
- RQ2従来のRLHFと比較して、DPOベースのアライメントは金融LLMのゼロショットパフォーマンスをどの程度向上させられるか?
- RQ3リtrievalおよびツール補強は、LLMの金融推論能力をどの程度向上させられるか?
- RQ4マルチモーダルLLMは、同時にテキスト、数値、表形式、視覚的金融データを効果的に処理・推論できるか?
- RQ5複雑な金融文脈において、金融LLMはホールリュケーションをどの程度正確に検出・回避できるか?
主な発見
- FinTral-DPO-T&Rは、FinSetベンチマークで評価された9つのタスクすべてでChatGPT-3.5を上回り、優れたゼロショット一般化性能を示している。
- モデルは、感情分析、固有表現認識、数値理解を含む、9つのテキストベースの金融タスクのうち5つでGPT-4を上回っている。
- GPT-4よりもはるかに小さいにもかかわらず、評価されたすべての金融タスクで最先端のパフォーマンスを達成している。
- リtrievalおよびツール補強プロンプティング(T&R)の導入により、特に複雑な金融推論タスクにおいて、推論能力と事実の整合性が顕著に向上している。
- 使用されたベンチマーク「FinSet」は、25の多様なデータセットをカバーする点で、これまでで最大かつ最も包括的な金融評価スイートであり、独自にホールリュケーションを測定している。
- モデルは強力なマルチモーダル能力を示しており、テキスト、数値、表形式、視覚的入力を統合して、包括的な金融文書理解を効果的に行っている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。