[论文解读] FinTral: A Family of GPT-4 Level Multimodal Financial Large Language Models
FinTral 引入了一类基于 Mistral-7b 的多模态金融大语言模型,通过领域特定预训练、指令微调以及使用 GPT-4 生成反馈的直接偏好优化(DPO)进行增强。其最佳变体 FinTral-DPO-T&R 在九项金融任务中的五项上达到 GPT-4 水平的表现,并在所有任务的零 shot 评估中超越了 ChatGPT-3.5 和 GPT-4,展现出最先进的多模态金融推理能力。
We introduce FinTral, a suite of state-of-the-art multimodal large language models (LLMs) built upon the Mistral-7b model and tailored for financial analysis. FinTral integrates textual, numerical, tabular, and image data. We enhance FinTral with domain-specific pretraining, instruction fine-tuning, and RLAIF training by exploiting a large collection of textual and visual datasets we curate for this work. We also introduce an extensive benchmark featuring nine tasks and 25 datasets for evaluation, including hallucinations in the financial domain. Our FinTral model trained with direct preference optimization employing advanced Tools and Retrieval methods, dubbed FinTral-DPO-T&R, demonstrates an exceptional zero-shot performance. It outperforms ChatGPT-3.5 in all tasks and surpasses GPT-4 in five out of nine tasks, marking a significant advancement in AI-driven financial technology. We also demonstrate that FinTral has the potential to excel in real-time analysis and decision-making in diverse financial contexts. The GitHub repository for FinTral is available at \url{https://github.com/UBC-NLP/fintral}.
研究动机与目标
- 为解决现有大语言模型在金融分析中的局限性,特别是其在数值推理、领域特定术语以及金融语境下幻觉生成方面的问题。
- 开发一种能够处理文本、数值、表格和视觉金融数据的多模态大语言模型,以实现对金融文档的全面理解。
- 构建一个大规模、全面的基准测试集——FinSet,用于评估金融大语言模型,涵盖 25 个数据集和九项任务,包括幻觉检测。
- 证明通过先进的对齐技术和检索增强提示,较小的、领域适配的大语言模型可在关键金融推理任务中超越 GPT-4 等更大模型。
提出的方法
- FinTral 基于 Mistral-7b 架构,通过在精选的金融文本和视觉数据上进行领域特定预训练进行微调。
- 采用大规模、精选的指令数据集进行指令微调,该数据集专为金融任务(如情感分析、实体识别和金融推理)量身定制。
- 使用直接偏好优化(DPO)将模型与 GPT-4 生成的回复对齐,从而在无需人类反馈强化学习(RLHF)的情况下提升对齐效果。
- 通过引入检索和工具增强提示(T&R),使模型在推理过程中能够动态访问外部知识。
- 通过 CLIP 视觉编码器增强视觉能力,构建 FinTralVL,实现对包含图像或图表的金融文档的多模态理解。
- 构建了一个广泛的基准测试集 FinSet,涵盖九项任务和 25 个数据集,包括幻觉检测,以严格评估模型性能。

实验结果
研究问题
- RQ1较小的、领域适配的大语言模型是否能在金融推理任务中达到 GPT-4 水平的表现?
- RQ2与传统的 RLHF 相比,基于 DPO 的对齐在多大程度上能提升金融大语言模型的零 shot 表现?
- RQ3检索和工具增强在多大程度上能提升大语言模型的金融推理能力?
- RQ4多模态大语言模型是否能有效同时处理和推理文本、数值、表格和视觉金融数据?
- RQ5金融大语言模型在复杂金融语境下检测并避免幻觉的能力如何?
主要发现
- FinTral-DPO-T&R 在 FinSet 基准测试的九项评估任务中全面超越 ChatGPT-3.5,展现出卓越的零 shot 泛化能力。
- 该模型在九项基于文本的金融任务中的五项上超越 GPT-4,包括情感分析、命名实体识别和数字理解。
- 尽管参数量远小于 GPT-4,FinTral-DPO 在所有评估的金融任务中均达到最先进水平。
- 引入检索和工具增强提示(T&R)显著提升了推理能力和事实一致性,尤其在复杂的金融推理任务中表现突出。
- 所使用的基准测试集 FinSet 是迄今为止最大、最全面的金融评估套件,其独特之处在于在 25 个多样化数据集中测量幻觉现象。
- 该模型展现出强大的多模态能力,能有效整合文本、数值、表格和视觉输入,实现对金融文档的全面理解。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。