[论文解读] DISC-FinLLM: A Chinese Financial Large Language Model based on Multiple Experts Fine-tuning
本文提出 DISC-FinLLM,一种通过在四个任务特定指令数据集(金融咨询、自然语言处理任务、计算、检索增强生成)上使用 LoRA 适配的多专家微调框架(MEFF)增强的中文金融大语言模型。该模型在多个基准测试中优于基础大语言模型及现有金融模型,尤其在金融问答、推理和知识检索方面表现更优,特别是在结合检索和计算插件时表现尤为突出。
We propose Multiple Experts Fine-tuning Framework to build a financial large language model (LLM), DISC-FinLLM. Our methodology improves general LLMs by endowing them with multi-turn question answering abilities, domain text processing capabilities, mathematical computation skills, and retrieval-enhanced generation capabilities. We build a financial instruction-tuning dataset named DISC-FIN-SFT, including instruction samples of four categories (consulting, NLP tasks, computing and retrieval-augmented generation). Evaluations conducted on multiple benchmarks demonstrate that our model performs better than baseline models in various financial scenarios. Further resources can be found at https://github.com/FudanDISC/DISC-FinLLM.
研究动机与目标
- 为解决通用大语言模型在中文语境下处理复杂金融任务的局限性。
- 克服现有金融自然语言处理模型中标签化金融数据稀缺及领域特定知识不足的问题。
- 开发一个统一的、开源的金融大语言模型,能够支持多种金融任务中的多样化用户群体。
- 通过多轮对话、数值推理和检索增强生成能力,提升大语言模型在真实金融应用中的表现。
- 评估任务特定 LoRA 微调与检索增强生成在金融推理与决策支持中的有效性。
提出的方法
- 作者构建了 DISC-FIN-SFT,一个包含四种类别的监督指令数据集:金融咨询、自然语言处理任务、金融计算与检索增强生成。
- 采用多专家微调框架(MEFF)在四个数据子集上分别训练四个 LoRA 适配器,实现任务特定的专业化。
- 每个 LoRA 适配器在 Baichuan-13B-Chat 基础模型上进行微调,使其专精于四种金融能力之一:对话、自然语言处理、计算或检索。
- 在推理过程中使用系统提示(system prompts)引导模型行为,提升其在多样化金融场景下的表现。
- 模型集成计算插件,以提升金融公式构建与数值推理任务的准确性。
- 评估采用多个基准测试与基于 GPT-3.5 的人工评估,针对检索与推理任务,评估指标包括准确率、有用性、语言质量与反思性。
实验结果
研究问题
- RQ1多专家微调框架能否提升通用中文大语言模型在多样化金融自然语言处理任务中的表现?
- RQ2任务特定的 LoRA 微调在增强基础大语言模型在金融咨询、计算与检索方面能力方面的有效性如何?
- RQ3检索增强生成在多大程度上提升了金融问答中的事实准确性与分析深度?
- RQ4计算插件的集成对模型在金融数值推理任务中表现的影响如何?
- RQ5MEFF 框架是否在泛化能力与适应性方面优于在单一统一数据集上进行全参数微调?
主要发现
- 在 LoRA 微调后,DISC-FinLLM 在六个未见过的金融自然语言处理任务上,平均性能较基础 Baichuan-13B-Chat 模型提升 2 至 9 分。
- 该模型优于现有金融大语言模型(如 FinGPT-v3),在人工评估中取得非专有模型中的最佳平均得分,仅次于 GPT-4 与 ChatGPT。
- 在金融计算任务中,集成计算插件的模型在准确率上比 ChatGPT 还高出 0.09 分,证明了插件集成的有效性。
- 在基于检索的任务中,该模型在所有四项 GPT-3.5 评估指标(准确率、有用性、语言质量与反思性)上均显著优于基线模型。
- 消融实验表明,全参数微调的表现劣于任务特定的 LoRA 微调,验证了 MEFF 方法的必要性。
- 该模型展现出强大的泛化能力,在训练数据中未涵盖的自然语言处理任务上也取得高分,表明其具备稳健的迁移学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。