Skip to main content
QUICK REVIEW

[论文解读] CFGPT: Chinese Financial Assistant with Large Language Model

Jiangtong Li, Yuxuan Bian|arXiv (Cornell University)|Sep 19, 2023
Stock Market Forecasting Methods被引用 5
一句话总结

CFGPT 是一个中文金融大语言模型框架,整合了精选的金融数据集(CFData)、微调后的 70 亿参数大语言模型(CFLLM)以及真实场景的部署系统(CFAPP)。该模型在 1410 亿个 token 上进行预训练,在 150 亿个 token 上进行监督微调,涵盖六项金融任务,展现出在中文金融自然语言处理任务中的强大零样本和少样本性能,相关代码与模型已开源,供社区使用。

ABSTRACT

Large language models (LLMs) have demonstrated great potential in natural language processing tasks within the financial domain. In this work, we present a Chinese Financial Generative Pre-trained Transformer framework, named CFGPT, which includes a dataset~(CFData) for pre-training and supervised fine-tuning, a financial LLM~(CFLLM) to adeptly manage financial texts, and a deployment framework~(CFAPP) designed to navigate real-world financial applications. The CFData comprising both a pre-training dataset and a supervised fine-tuning dataset, where the pre-training dataset collates Chinese financial data and analytics, alongside a smaller subset of general-purpose text with 584M documents and 141B tokens in total, and the supervised fine-tuning dataset is tailored for six distinct financial tasks, embodying various facets of financial analysis and decision-making with 1.5M instruction pairs and 1.5B tokens in total. The CFLLM, which is based on InternLM-7B to balance the model capability and size, is trained on CFData in two stage, continued pre-training and supervised fine-tuning. The CFAPP is centered on large language models (LLMs) and augmented with additional modules to ensure multifaceted functionality in real-world application. Our codes are released at https://github.com/TongjiFinLab/CFGPT.

研究动机与目标

  • 为解决中文金融文本领域缺乏专用大语言模型的问题,开发专用框架。
  • 构建一个全面的中文金融数据集(CFData),整合预训练与监督微调数据,用于金融 NLP 任务。
  • 基于 CFData 使用两阶段训练方法(持续预训练与监督微调)训练一个面向金融优化的大语言模型(CFLLM)。
  • 设计实用的部署框架(CFAPP),支持多种输入格式与输出类型,适用于真实金融应用场景。
  • 开源代码与模型,推动中文金融大语言模型的研究与应用发展。

提出的方法

  • 构建 CFData,一个双阶段数据集:5.84 亿篇文档(1410 亿 token)用于预训练,150 万条指令对(150 亿 token)用于六项金融任务的监督微调。
  • 选择 InternLM-7B 作为基础模型,在性能与效率之间取得平衡,实现对金融语言的有效适配。
  • 采用两阶段训练:首先在金融与通用中文语料上进行持续预训练,随后在任务特定的指令对上进行监督微调。
  • 设计 CFAPP 作为以大语言模型为核心的模块化部署系统,集成向量数据库、思维链推理与领域专用模块,提升响应的准确性与可靠性。
  • 支持多模态输入(文本、音频、PDF)与多种输出格式(原始文本、模板、思维导图),提升在真实金融场景中的可用性。
  • 支持扩展至 InternLM-7B 以外的其他大语言模型,增强框架的灵活性。

实验结果

研究问题

  • RQ1在精选的中文金融数据集上训练的领域专用大语言模型,是否能在金融 NLP 任务上超越通用大语言模型的表现?
  • RQ2两阶段训练(持续预训练后接监督微调)在提升中文金融文本理解中的零样本与少样本能力方面效果如何?
  • RQ3模块化部署框架(CFAPP)在真实金融应用中,对支持多样化输入格式与输出类型的能力有多强?
  • RQ4向量数据库与思维链推理模块的集成,如何提升金融大语言模型在事实准确性与推理能力方面的表现?
  • RQ5在中文金融语境下,领域专用微调对情感分析、事件检测与股价走势预测等任务有何影响?

主要发现

  • CFLLM-ins-7B 模型在六项金融任务中均表现出色,验证了领域专用持续预训练与监督微调的有效性。
  • CFData 数据集提供 1410 亿 token 用于预训练与 150 亿 token 用于微调,是训练中文金融大语言模型的全面资源。
  • CFAPP 框架成功支持多种输入类型(文本、音频、PDF)与输出格式(原始文本、模板、思维导图),显著提升实际应用中的可用性。
  • 向量数据库与思维链模块的集成,提升了金融推理任务中响应的可靠性与事实一致性。
  • 通过 GitHub 开源代码、模型与数据集,有望加速中文金融大语言模型领域的研究与创新。
  • 初步评估证实,该模型在零样本与少样本设置下具备强大能力,尤其在情感分析、摘要生成与金融文本问答任务中表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。